Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Опыт GUI-агента полезнее делить на отдельные компоненты, а не целиком записывать в веса модели или хранить в контексте. В препринте Beining Wu, Zihao Ding и Jun Huang, который не проходил рецензирование и где числа получили сами авторы, такая маршрутизация повысила успешность на 3,5 процентного пункта относительно лучшего единого способа хранения. Для архитектуры агента это означает два параллельных контура памяти вместо выбора одного из них.
Траектория смешивает знания с разным сроком жизни
Траектория хранит весь ход выполнения задачи: состояния интерфейса, действия и их результаты. Дообучение пытается целиком перенести этот опыт в веса модели, а поиск по памяти добавляет подходящие записи в контекст перед следующим действием. Сравнение этих подходов даёт нестабильные результаты, потому что одна траектория объединяет сведения разной природы.
Работа делит опыт на четыре компонента. Локатор описывает, где находится элемент интерфейса. Процедура задаёт короткую последовательность действий для подзадачи. Факт о состоянии фиксирует условие, без которого действие не сработает. Урок сопоставляет неудачное действие с тем, которое помогло в той же ситуации.
Для каждого компонента измеряют повторяемость и зависимость от состояния. Повторяемость показывает, как часто одно и то же знание встречается в несвязанных задачах приложения. Зависимость от состояния показывает, сохранит ли оно смысл при переходе на другой экран или в другую конфигурацию данных.
Высокая повторяемость склоняет правило в сторону весов: модель может применять такое знание без отдельного поиска. Сильная зависимость от текущего состояния склоняет его в сторону контекста: агент получает запись только тогда, когда состояние достаточно похоже на исходное. Оба признака вычисляют по накопленному опыту до дообучения.
Для честного сравнения одни и те же компоненты по очереди отправляли в контекст и в веса, а затем запускали на одинаковых отложенных заданиях. Проверка охватила три семейства моделей размером 7–8 млрд параметров, MobileGym и AndroidWorld. Успех определяли штатные проверяющие среды, а не модель-оценщик; каждый вариант повторяли с тремя начальными значениями генератора случайных чисел.
Локаторы закрепляются в весах, процедуры остаются рядом с задачей
Локаторы выиграли от записи в веса: разница с контекстом составила 4,9 процентного пункта. Их ключи повторяются между задачами, а положение элемента относительно слабо зависит от состояния. Модель получает пользу от такого навыка во многих эпизодах без затрат на поиск записи.
Для процедур контекст оказался лучше на 4,2 пункта, для фактов о состоянии — на 4,1 пункта. Эти сведения нужны в конкретной части сценария и могут направить агента не туда, если закрепить их как общее поведение. Уроки чаще выигрывали в весах, но результат менялся между отдельными условиями эксперимента.
Линейное правило по двум признакам выбрало правильное направление во всех 24 проверках на семействе моделей, которое исключали при настройке правила. Маршрутизация по нему в среднем обошла лучший вариант, где весь опыт отправляли только в одно место, на 3,5 пункта.
Дополнительные эксперименты поддержали логику правила. Когда обучающие примеры процедур повторяли чаще, они сдвигались в сторону весов. Когда при поиске фактов убирали точное совпадение состояния, контекст приносил меньше пользы.
Два маршрута не всегда складываются. После записи повторяемого знания в веса агент реже использовал заметку с тем же содержанием. Контекст сохранял ценность для сведений, которых не хватало модели, а дообучение хуже переносило опыт между агентами с разной политикой действий.
Архитектуре памяти нужны два управляемых маршрута
Работа не требует немедленно менять модель или способ дообучения. Она меняет единицу, с которой стоит проектировать накопление опыта: вместо библиотеки полных траекторий системе нужны типизированные записи с ключом, исходным состоянием и признаком повторяемости.
Стабильные элементы интерфейса и регулярно повторяющиеся приёмы можно собирать в набор для дообучения. Процедуры, предусловия и сведения, которые действуют только на определённом экране, безопаснее хранить в поисковой памяти. При замене базовой модели такую память можно проверить с новым агентом отдельно, тогда как адаптацию весов придётся оценивать заново.
Для продуктовой команды разумный следующий шаг — добавить классификацию опыта и сравнить оба маршрута на одинаковых записях. Граница применимости пока проходит по мобильным GUI-агентам и моделям исследованного масштаба, поэтому правило стоит рассматривать как проверяемую схему проектирования, а не готовую константу для веб-агентов и настольных приложений.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



