Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
OdoBot выполняет повторяемые задачи в веб-интерфейсе с меньшим расходом токенов. В не прошедшем рецензирование препринте University of Alberta с замерами самих авторов агент тратил на задачу на 44% меньше токенов, чем Agent-E. Такой подход позволяет обменять первоначальную настройку под конкретное приложение на более низкую стоимость каждого следующего запуска.
Агент запоминает поведение приложения, а не всю историю действий
Обычный веб-агент на каждом шаге передаёт LLM состояние интерфейса и предыдущие действия. Чем сложнее страница и длиннее задача, тем больше контекст: модель снова читает элементы страницы, выясняет, где находится, и решает, что делать дальше.
OdoBot сначала записывает успешные демонстрации работы с приложением. Расширение браузера фиксирует клики, ввод данных и выбор элементов, а также события самого приложения: изменение адреса, сетевые запросы, мутации GraphQL и изменения дерева элементов страницы.
Из событий агент строит ориентированный граф. Его вершины обозначают эквивалентные действия и реакции приложения, а рёбра сохраняют их порядок. Например, клики по одной кнопке объединяются, если совпадают путь страницы, XPath элемента и текст кнопки.
LLM описывает каждую записанную траекторию обычным языком и переводит описание в векторное представление. Когда приходит новая задача, OdoBot находит наиболее близкий известный сценарий и выбирает путь по графу. Во время выполнения он сверяет адреса и сетевые события с ожидаемыми без обращения к LLM.
Модель подключается только там, где нужно учесть содержание конкретной задачи: выбрать курс, пункт списка или значение поля. Ей передают не всю страницу, а небольшой фрагмент DOM с подходящими элементами. Архитектура разделяет управление процессом и смысловой выбор: первое выполняет граф, второе — LLM.
Метод проверяли на 45 типах задач в Canvas LMS. Для построения графа и сравнительных запусков использовали разные экземпляры задач; среду сбрасывали между сериями, а всем агентам дали одну и ту же LLM. В набор вошли операции, которые меняют данные на сервере, поэтому успех определяли по сетевым запросам, а не с помощью модели-оценщика.
Меньший контекст сохранил долю выполненных задач
OdoBot успешно завершил 76,4% задач и расходовал в среднем 19,9 тысячи токенов на одну задачу. Agent-E справился с 85,3%, то есть чаще доводил сценарий до конца, но уступил по расходу токенов.
Лучшая конфигурация WebVoyager завершила 72,9% задач. OdoBot превысил этот результат со статистически значимой разницей и потратил на 80% меньше токенов. Снижение разрешения снимков помогало WebVoyager экономить контекст, но одновременно резко ухудшало его способность распознавать элементы интерфейса.
Агенты ошибались по-разным причинам. Agent-E и WebVoyager могли потеряться в навигации, не распознать переключатель или отказаться выполнять учебное задание. OdoBot знал путь из демонстрации, но чаще ломался там, где граф неверно описывал страницу или интерфейс менялся динамически.
Подход окупается на стабильных и частых сценариях
Построение модели поведения потребовало 10,3 миллиона токенов. Экономия относительно Agent-E компенсировала эти затраты после 676 выполненных задач, а относительно WebVoyager — после 120. Для разового запуска предварительная подготовка слишком велика, но у регулярно повторяемой операции появляется понятная точка окупаемости.
Работа меняет планы команд, которые автоматизируют один известный веб-продукт: внутреннюю административную систему, учебную платформу или кабинет оператора. Вместо универсального агента можно заранее записать основные маршруты, вынести контроль процесса из LLM и оставить модели только выбор значений на развилках.
В бюджет придётся заложить сбор успешных демонстраций и обновление графа после изменений интерфейса. OdoBot опирается на XPath, который легко ломается при перестройке страницы. Особенно плохо метод переносит экраны, где разные элементы последовательно появляются в одном месте, как вопросы многостраничной анкеты или теста.
Проверка охватывает одно приложение — Canvas — и сценарии с изменениями на сервере. Она показывает экономию для повторяемой работы в знакомом интерфейсе, но не подтверждает, что тот же графовый подход сохранит результат на открытых сайтах или ранее не встречавшихся задачах.
Практичная схема для продукта — сочетать два режима. Граф ведёт агента по изученным участкам с низким расходом токенов, а обычный веб-агент принимает управление, если наблюдаемое состояние не совпало с известным маршрутом. Сама работа предлагает такое сочетание как направление развития, но не проверяет его экспериментально.
Источники
Иллюстрация: рисунок из статьи «Token Efficient Task Execution via Application Behavior Modeling for Web Agents», Alexandru Ianta, Eleni Stroulia, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



