Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Навыки агентов управления интерфейсом можно исправлять прямо во время работы и сохранять для следующих задач. Команда Zhejiang University и UESTC получила на MobileWorld прирост до 16,2 процентного пункта, хотя препринт ещё не рецензировали, а все числа получили сами авторы. Для продукта это означает, что часть ошибок можно устранять на уровне исполняемых инструкций, не меняя веса модели.
Навык стал пакетом из отдельных файлов
Обычный навык GUI-агента часто выглядит как один длинный документ: в нём смешаны план действий, способы найти элементы интерфейса и инструкции на случай сбоя. Такое описание удобно передать модели целиком, но трудно исправить точечно. Ошибка при поиске кнопки не должна заставлять переписывать весь сценарий.
В EvoSkill-GUI навык хранится как пакет с отдельными файлами. Метаданные описывают назначение, приложение и платформу; план задаёт последовательность действий; резервные способы поиска помогают обнаружить переместившийся элемент; правила восстановления обрабатывают всплывающие окна и неожиданные состояния. Отдельно сохраняются средства работы с деревом доступности и примеры прошлых сбоев.
Модель редактирует пакет через ограниченный набор инструментов: может прочитать, найти, записать или дополнить разрешённый файл и создать запись о неудаче. Она не получает произвольный доступ за пределами структуры навыка. Благодаря этому изменение остаётся локальным и его можно проверить: ошибка плана меняет план, а ненадёжный способ найти элемент — резервную локализацию.
Для повторного использования система ищет навык по коротким метаданным, а не сравнивает запрос со всем содержимым файлов. Если подходящего варианта нет, агент создаёт новый пакет. Исправленный и проверенный выполнением навык возвращается в библиотеку, поэтому похожая задача может начать работу с уже накопленной процедурой.
Неудачная попытка превращается в исправление
Цикл состоит из исполнения, разбора ошибки и правки. Во время выполнения агент может сразу скорректировать локальную проблему, например добавить обработку всплывающего окна. Если попытка завершилась неудачей, та же базовая модель запускается в отдельной роли критика и определяет шаг сбоя, непосредственную причину и подходящий файл для изменения.
Критик видит только инструкцию, наблюдения и действия из завершённой попытки. Ему не показывают содержимое навыка, скрытые рассуждения исполнителя или правильную траекторию. Такое разделение не даёт критической части просто подсмотреть ответ, а также избавляет систему от отдельной более сильной модели-оценщика.
На AndroidWorld максимальный прирост составил 6 процентных пунктов, на OSWorld — 10,5. На MobileWorld исправление навыков дало успешность 69,5% против 62,8% у повторной выборки при сопоставимом вычислительном бюджете. Следовательно, выигрыш нельзя свести только к дополнительным попыткам.
Основная прибавка на MobileWorld накопилась за первые три цикла: успешность выросла на 12,4 процентного пункта, после чего результат приблизился к плато. Это задаёт практическую границу: бесконечно разбирать один сбой невыгодно, а полезные исправления лучше переносить на следующие задания.
Метод проверяли на MobileWorld, AndroidWorld и OSWorld с Claude-Sonnet-4.6, моделями Qwen, GUI-Owl-1.5-8B и MAI-UI-8B. Попытку ограничивали 50 действиями, а после сбоя разрешали не более двух раундов исправления. Повторное использование на AndroidWorld изучали на параметризованных вариантах тех же семейств задач, поэтому эти результаты не показывают перенос между принципиально новыми приложениями.
Командам стоит менять слой навыков, а не модель
Работа не требует переходить на другую базовую модель или запускать дообучение после каждого изменения интерфейса. Она предлагает вынести процедурные знания в версионируемый слой между моделью и средой: отдельно хранить план, способы найти элементы, обработку сбоев и историю неудач. Такой слой проще обновлять и проверять, чем единый текстовый запрос.
Схема подходит системам, где повторяются близкие операции и ошибка сообщает, что именно сломалось: изменился путь по интерфейсу, пропал элемент или возникло незапланированное состояние. Если задачи редко повторяются, библиотека не успеет окупить дополнительные вызовы. Каждая неудачная попытка требует отдельного запуска критика и ещё одного запуска для правки, что увеличивает задержку.
Автоматически принимать все исправления пока рискованно. В EvoSkill-GUI нет формального проверяющего механизма, который отклонит вредную правку, поэтому неверный разбор может испортить ранее рабочий пакет и распространить ошибку на следующие задачи. Для внедрения отсюда следуют версионирование навыков, журнал изменений и ручное подтверждение правок для действий с файлами, настройками или учётными записями.
Источники
Иллюстрация: рисунок из статьи «Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents», Bofan Chen, Boxuan Zhang, Fei Tang и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



