Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
GUI-агента научили улучшать исполняемую обвязку вокруг неизменной модели по результатам собственных запусков. Команда The Chinese University of Hong Kong, Shenzhen, Tianjin University и других исследовательских центров получила для Qwen3-VL-32B-Instruct прибавку 12,33 процентного пункта, хотя работа не рецензирована и числа в ней получены самими авторами. Это предлагает альтернативу переобучению модели: сначала можно исправить среду, которая показывает ей интерфейс, исполняет действия и решает, когда задача завершена.
Скриншоты связывают намерение агента с результатом
Исполняемая обвязка (harness) формирует контекст для модели, хранит память, вызывает инструменты и управляет проверкой результата, восстановлением после ошибки и остановкой. GUI-HARVEST меняет именно этот код, а веса базовой модели оставляет неизменными.
Текстового журнала для такой правки недостаточно. Агент может написать, что нажал Save и закончил задачу, хотя на экране остался открытый диалог. Поэтому система сопоставляет ответ модели, фактически выполненное действие и скриншоты до и после него. В диагноз попадает не общее описание неудачи, а конкретный переход интерфейса, где намерение разошлось с наблюдаемым результатом.
Одну задачу запускают повторно из чистого состояния. Если часть запусков завершилась успешно, а часть — нет, успешная траектория служит контрольным примером: система ищет шаг, после которого поведение разошлось. Это важно для настольных интерфейсов, где одинаковые команды могут дать разные результаты из-за времени загрузки, всплывающих окон и изменений начального кадра.
Затем GUI-HARVEST объединяет подтверждённые находки из нескольких задач в повторяющиеся сценарии. Например, незавершённое редактирование поля в Chrome, Impress и Calc может указывать на общий дефект проверки завершения, а не на три независимые ошибки модели. Система связывает такой сценарий с участком исходного кода и предлагает ограниченную правку в разрешённых файлах.
Правку проверяют и по оценке, и по поведению
До запуска изменённой обвязки система записывает ожидаемый наблюдаемый эффект. Если правка должна исправить преждевременную остановку, прогноз может требовать, чтобы агент сначала закрыл диалог или подтвердил ввод и только затем сообщил об успехе. Это не позволяет задним числом объявить полезным любое изменение, после которого выросла итоговая оценка.
Кандидат сначала проходит проверку разрешённых областей кода, синтаксиса, импортов, совместимости интерфейсов и локальных тестов. После этого его запускают на поисковой и проверочной частях набора задач. Правку принимают, только если результат не ухудшился ни на одной части и вырос хотя бы на одной.
Отдельная проверка сопоставляет прогноз с новыми траекториями и скриншотами. Для принятия недостаточно случайного роста средней оценки: наблюдаемое поведение должно измениться в ожидаемую сторону. Неудачный кандидат откатывают, а журнал сохраняет патч, прогноз, оценки и причину отказа, чтобы следующая попытка не повторяла прежнее решение.
Закрытая тестовая часть остаётся недоступной до конца поиска. Это отделяет подбор правок от итоговой оценки и снижает риск подогнать обвязку под задачи, на которых она менялась.
Сначала улучшить обвязку, затем решать вопрос с моделью
Метод проверяли на 361 задаче OSWorld-Verified и шести базовых моделях: открытых общего назначения, специализированных для интерфейсов и проприетарных. Обвязку меняли по прогонам с лимитом 15 шагов, каждую задачу повторяли трижды. На Qwen3-VL-32B-Instruct GUI-HARVEST также обошёл Self-Harness и Meta-Harness при одинаковой исходной обвязке.
Авторы перенесли уже выбранную обвязку с OSWorld на WindowsAgentArena без дополнительного поиска правок. Для GPT-5 результат вырос на 13,87 процентного пункта. Это существеннее результата на одном тестовом наборе: часть изменений пережила смену среды и операционной системы.
Для продуктовой команды работа меняет порядок экспериментов. Если модель уже умеет распознавать экран и вызывать действия, слабое место может находиться в проверке результата, обработке диалогов, восстановлении после неудачного клика или правиле остановки. В таком случае новый промпт или более крупная модель не обязательно будут первым и самым точным вмешательством.
Подход требует воспроизводимых запусков, скриншотов по шагам, фактически выполненных действий и автоматической оценки конечного состояния. Без этих данных система не сможет связать ошибку с переходом интерфейса и проверить, что патч исправил именно заявленное поведение. Повторные полные прогоны также увеличивают вычислительные расходы, поэтому метод лучше подходит задачам, для которых можно автоматически восстанавливать среду и измерять результат.
Практический вывод не в том, что обвязка заменяет улучшение модели. GUI-HARVEST показывает, что её стоит рассматривать как отдельный оптимизируемый слой: заморозить модель, собрать сравнимые траектории, найти повторяющийся сбой и принять только ту правку, которая проходит проверку оценки и поведения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



