Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Набор инструментов веб-агента научились автоматически сокращать и обновлять по реальным запросам, сохраняя запасной режим управления браузером. В работе University of Michigan и Microsoft Research доля правильно выполненных заданий выросла с 87,5% до 90,6% при переходе от одного ReAct к AutoTailor, хотя препринт не рецензирован и все числа получили сами авторы. Это позволяет не передавать модели каталог из сотен похожих API при каждом запросе.
Как траектория превращается в инструмент
AutoTailor начинает с записанных траекторий: последовательностей переходов, кликов, ввода текста и других действий, которыми агент решал задачи на сайте. Модель преобразует каждую траекторию в асинхронную функцию на Playwright, пригодную для повторного запуска.
Конкретные имена, поисковые запросы, заголовки и тексты становятся параметрами функции. Постоянные элементы интерфейса и адреса остаются в коде. В результате вместо сценария для одного случая получается API уровня «найти публикацию и выполнить действие», которому можно передать новые значения.
Первый фильтр удаляет слишком мелкие, чрезмерно узкие и функционально повторяющиеся инструменты. AutoTailor группирует описания по смысловой близости, а модель-оценщик сравнивает назначение, шаги и исполняемый код похожих функций. Из подтверждённых дублей система оставляет более полный вариант, а при равенстве предпочитает более короткую траекторию.
Второй фильтр оценивает, насколько вероятно, что функция понадобится на целевом сайте. Он сохраняет востребованные инструменты, но не выбрасывает целую категорию только из-за низкой ожидаемой частоты: из непокрытой смысловой группы может остаться лучший кандидат. Выбранные функции регистрируются как инструменты MCP с именем, описанием и схемой параметров.
Почему статического отбора оказалось недостаточно
Начальный каталог содержал 1283 API, а два офлайн-фильтра сократили его до 87. Однако оценка вероятного спроса ошибается на редких задачах: небольшой статический набор уменьшает контекст, но чаще передаёт работу запасному режиму ReAct.
ReAct управляет браузером пошагово: модель изучает текущее состояние страницы, выбирает следующее действие и снова проверяет результат. Такой путь помогает закрыть задачу, для которой нет готового API, но требует повторных обращений к модели и передачи страницы в контекст.
Динамический отбор использует журналы выполнения. AutoTailor записывает намерение пользователя, вызванные инструменты и исход задачи, а затем ищет повторяющиеся пробелы: случаи, где подходящего API не нашлось или выбранный инструмент не справился. Система нормализует формулировки, группирует похожие запросы и ищет подходящие функции в более широком пуле уже проверенных кандидатов.
Полезные кандидаты добавляются в активный каталог, а инструменты, которыми долго не пользовались, могут быть удалены. Уже вызванные и недавно добавленные функции защищены от немедленного удаления. После такой подстройки активный набор сократился до 33 API, но лучше соответствовал фактическому распределению задач.
По сравнению с одним ReAct средний расход входных токенов снизился на 57,8%, а задержка — на 29,4%. Важен не сам минимальный размер каталога: промежуточный статический набор переносил часть расходов в запасной режим. Выигрыш появился, когда состав инструментов начали менять по результатам работы.
Что меняется в архитектуре веб-агента
Работа предлагает вынести управление инструментами в отдельный контур, а не считать каталог API постоянной частью агента. Для команды это означает три хранилища: исходные траектории, широкий проверенный пул функций и небольшой активный набор. Между ними нужен процесс, который собирает журналы, обнаруживает повторяющиеся пробелы и безопасно обновляет MCP-сервер.
Такой подход имеет смысл, если запросы повторяются, а пошаговая работа через ReAct заметно влияет на стоимость и задержку. Частые операции можно выполнять заранее подготовленным кодом, а ReAct оставить для новых и редких случаев. Активный каталог при этом следует выбирать по рабочему трафику, а не только по экспертной оценке до запуска.
Автоматическое добавление функции не заменяет проверку кода. Поскольку активный набор невелик, команда может тестировать популярные сценарии до развёртывания, ограничивать допустимые действия и отдельно контролировать операции с необратимыми последствиями. AutoTailor решает вопрос состава каталога, но не доказывает безопасность сгенерированных программ.
Метод проверяли на 106 шаблонных задачах среды WebArena Postmill: сравнивали полный, статически отфильтрованный и динамически подобранный наборы с ReAct и без него. Такой эксперимент показывает адаптацию к устойчивому имитированному спросу, но не воспроизводит шумные формулировки, смену интересов и длительную эксплуатацию с реальными пользователями. Поэтому менять базовую модель или полностью отказываться от ReAct рано; практический результат работы — основание испытать динамический каталог инструментов на собственных журналах.
Источники
Иллюстрация: рисунок из статьи «AutoTailor: Automatic, User-Aligned Capability Selection and Adaptation for Web Agents», Xinyun Cao, Adriana Szekeres, Fazle Elahi Faisal, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



