Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
GUI-агент может становиться точнее во время эксплуатации, даже если каждую задачу разрешено выполнить только один раз и пользователь не сообщает результат. В препринте, который не проходил рецензирование и где все числа получили сами авторы, Ziqiang Wang с соавторами улучшили долю успешно выполненных задач на 3–6 процентных пунктов. Такой подход позволяет обучать агента на повторяющихся рабочих операциях, но добавляет обновление весов и новые риски прямо в боевой контур.
Как учиться, если повторить действие нельзя
Авторы рассматривают сценарий, близкий к работе агента в почте, календаре, интернет-магазине или внутренней системе. Задачи поступают последовательно, каждое действие меняет среду, а отправленное письмо или оформленный заказ уже нельзя отменить ради ещё одной попытки.
Агент не получает эталонной разметки, награды или обратной связи от человека. Он также не может заранее потренироваться на будущих задачах, запускать несколько вариантов решения или возвращать среду в исходное состояние. Выполненная попытка сразу входит в итоговую оценку.
SOLO извлекает обучающий сигнал из самой истории действий. После завершения задачи модель-оценщик просматривает инструкцию, снимки экрана и действия агента, а затем решает, достигнут ли нужный результат. Оценщик не обращается к скрытой проверке бенчмарка и может ошибаться.
Если попытка признана успешной, она попадает в короткое скользящее окно. После неудачи другая модель ищет полезный префикс: например, агент не оформил заказ целиком, но нашёл товар и добавил его в корзину. Независимая модель проверяет, действительно ли этот промежуточный результат виден на последнем экране.
Принятые эпизоды обновляют адаптер низкого ранга, который занимает около 0,2% параметров основной модели. Сама модель остаётся замороженной. Обновление происходит только тогда, когда окно содержит хотя бы одну попытку, которую оценщик признал полностью успешной: это не даёт агенту учиться исключительно на переименованных фрагментах неудач.
SOLO не заставляет модель дословно повторять выполненные действия. Агент обучается на собственном распределении наиболее вероятных токенов и усиливает верхние варианты, не сводя выбор к единственной записанной последовательности. В эксперименте прямое копирование выполненных токенов постепенно удлиняло эпизоды и чаще доводило агента до лимита шагов.
Повторяющиеся задачи дали прибавку на трёх средах
Метод проверяли с UI-TARS-7B и Qwen3-VL-8B на потоках из WebArena, VisualWebArena и MobileWorld. Каждый поток проходил трижды, причём порядок задач менялся, а состояние среды сбрасывалось между раундами на веб-сайтах и перед каждой мобильной задачей. Это проверяет обучение на повторяющихся типах поручений, а не продолжение незавершённого состояния.
SOLO повысил долю успешных задач относительно тех же агентов с замороженными весами на 3–6 процентных пунктов. На веб-потоках он также обошёл два метода, которые сохраняют удачные последовательности действий во внешней памяти и добавляют их в контекст следующих запросов. На MobileWorld результат был сопоставим с одним из таких методов.
Эксперимент показывает адаптацию к конкретным сайтам и повторяющимся поручениям, а не универсальное улучшение агента. Потоки собраны из бенчмарков и повторяются ограниченное число раз; частоту похожих задач в реальной эксплуатации работа не измеряет. На MobileWorld исходные агенты выполняли меньше одной задачи из десяти, поэтому полностью успешные примеры для обучения встречались редко.
Меняет ли SOLO планы разработки GUI-агента
Работа меняет архитектурный выбор для продуктов со стабильным потоком повторяющихся операций. Если агент регулярно заполняет одни и те же формы, работает с ограниченным набором сайтов или обслуживает одного пользователя, команда может рассматривать веса как накопительное состояние наряду с внешней памятью. Отдельный набор размеченных траекторий для каждого нового шаблона тогда не обязателен.
Цена такого решения — дополнительный контур на каждую задачу. SOLO вызывает модель-оценщик после каждого эпизода, а после предполагаемой неудачи может сделать ещё два вызова для поиска и проверки полезного префикса. Затем система выполняет градиентный шаг по сохранённому окну, поэтому инфраструктуре нужен не только вывод модели, но и вычисления для её обновления.
Внешняя память остаётся проще для аудита: запись можно прочитать, удалить или исправить. Изменения в адаптере не так прозрачны и могут накапливать дрейф. Авторы показывают, что обнуление адаптера точно возвращает исходного замороженного агента, однако способ автоматически определить момент для такого сброса не проверяли.
Главный риск проходит через модели, которые отбирают обучающие эпизоды. Содержимое страницы может убедить оценщика или модель, предлагающую подзадачу, принять ошибочную траекторию, после чего она повлияет на веса. Проверок на специально подготовленных вредоносных страницах в работе не проводили, поэтому для боевого внедрения нужны изоляция адаптеров, журнал версий и возможность быстрого отката.
SOLO пока не заменяет предварительное обучение для разнообразных разовых задач. Он предлагает дополнительный механизм для продуктов, где поручения повторяются, повторный запуск опасен, а обратная связь от пользователя слишком редка. В таком контуре адаптер разумно проектировать как отдельное управляемое состояние, а не как необратимое изменение основной модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



