Журнал · Rit.work

AutoTailor сокращает набор инструментов веб-агента по реальному спросу

AutoTailor отбирает API веб-агента из записанных траекторий и обновляет их по журналам работы, сокращая расход токенов без снижения точности на тестовых задачах.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Набор инструментов веб-агента научились автоматически сокращать и обновлять по реальным запросам, сохраняя запасной режим управления браузером. В работе University of Michigan и Microsoft Research доля правильно выполненных заданий выросла с 87,5% до 90,6% при переходе от одного ReAct к AutoTailor, хотя препринт не рецензирован и все числа получили сами авторы. Это позволяет не передавать модели каталог из сотен похожих API при каждом запросе.

Как траектория превращается в инструмент

AutoTailor начинает с записанных траекторий: последовательностей переходов, кликов, ввода текста и других действий, которыми агент решал задачи на сайте. Модель преобразует каждую траекторию в асинхронную функцию на Playwright, пригодную для повторного запуска.

Конкретные имена, поисковые запросы, заголовки и тексты становятся параметрами функции. Постоянные элементы интерфейса и адреса остаются в коде. В результате вместо сценария для одного случая получается API уровня «найти публикацию и выполнить действие», которому можно передать новые значения.

Первый фильтр удаляет слишком мелкие, чрезмерно узкие и функционально повторяющиеся инструменты. AutoTailor группирует описания по смысловой близости, а модель-оценщик сравнивает назначение, шаги и исполняемый код похожих функций. Из подтверждённых дублей система оставляет более полный вариант, а при равенстве предпочитает более короткую траекторию.

Второй фильтр оценивает, насколько вероятно, что функция понадобится на целевом сайте. Он сохраняет востребованные инструменты, но не выбрасывает целую категорию только из-за низкой ожидаемой частоты: из непокрытой смысловой группы может остаться лучший кандидат. Выбранные функции регистрируются как инструменты MCP с именем, описанием и схемой параметров.

Почему статического отбора оказалось недостаточно

Начальный каталог содержал 1283 API, а два офлайн-фильтра сократили его до 87. Однако оценка вероятного спроса ошибается на редких задачах: небольшой статический набор уменьшает контекст, но чаще передаёт работу запасному режиму ReAct.

ReAct управляет браузером пошагово: модель изучает текущее состояние страницы, выбирает следующее действие и снова проверяет результат. Такой путь помогает закрыть задачу, для которой нет готового API, но требует повторных обращений к модели и передачи страницы в контекст.

Динамический отбор использует журналы выполнения. AutoTailor записывает намерение пользователя, вызванные инструменты и исход задачи, а затем ищет повторяющиеся пробелы: случаи, где подходящего API не нашлось или выбранный инструмент не справился. Система нормализует формулировки, группирует похожие запросы и ищет подходящие функции в более широком пуле уже проверенных кандидатов.

Полезные кандидаты добавляются в активный каталог, а инструменты, которыми долго не пользовались, могут быть удалены. Уже вызванные и недавно добавленные функции защищены от немедленного удаления. После такой подстройки активный набор сократился до 33 API, но лучше соответствовал фактическому распределению задач.

По сравнению с одним ReAct средний расход входных токенов снизился на 57,8%, а задержка — на 29,4%. Важен не сам минимальный размер каталога: промежуточный статический набор переносил часть расходов в запасной режим. Выигрыш появился, когда состав инструментов начали менять по результатам работы.

Что меняется в архитектуре веб-агента

Работа предлагает вынести управление инструментами в отдельный контур, а не считать каталог API постоянной частью агента. Для команды это означает три хранилища: исходные траектории, широкий проверенный пул функций и небольшой активный набор. Между ними нужен процесс, который собирает журналы, обнаруживает повторяющиеся пробелы и безопасно обновляет MCP-сервер.

Такой подход имеет смысл, если запросы повторяются, а пошаговая работа через ReAct заметно влияет на стоимость и задержку. Частые операции можно выполнять заранее подготовленным кодом, а ReAct оставить для новых и редких случаев. Активный каталог при этом следует выбирать по рабочему трафику, а не только по экспертной оценке до запуска.

Автоматическое добавление функции не заменяет проверку кода. Поскольку активный набор невелик, команда может тестировать популярные сценарии до развёртывания, ограничивать допустимые действия и отдельно контролировать операции с необратимыми последствиями. AutoTailor решает вопрос состава каталога, но не доказывает безопасность сгенерированных программ.

Метод проверяли на 106 шаблонных задачах среды WebArena Postmill: сравнивали полный, статически отфильтрованный и динамически подобранный наборы с ReAct и без него. Такой эксперимент показывает адаптацию к устойчивому имитированному спросу, но не воспроизводит шумные формулировки, смену интересов и длительную эксплуатацию с реальными пользователями. Поэтому менять базовую модель или полностью отказываться от ReAct рано; практический результат работы — основание испытать динамический каталог инструментов на собственных журналах.

Источники

Иллюстрация: рисунок из статьи «AutoTailor: Automatic, User-Aligned Capability Selection and Adaptation for Web Agents», Xinyun Cao, Adriana Szekeres, Fazle Elahi Faisal, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу