Журнал · Rit.work

OdoBot сокращает расход токенов с помощью модели поведения приложения

OdoBot строит граф действий по успешным сценариям и тратит меньше токенов, чем Agent-E и WebVoyager, но требует стабильного интерфейса и затрат на подготовку.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

OdoBot выполняет повторяемые задачи в веб-интерфейсе с меньшим расходом токенов. В не прошедшем рецензирование препринте University of Alberta с замерами самих авторов агент тратил на задачу на 44% меньше токенов, чем Agent-E. Такой подход позволяет обменять первоначальную настройку под конкретное приложение на более низкую стоимость каждого следующего запуска.

Агент запоминает поведение приложения, а не всю историю действий

Обычный веб-агент на каждом шаге передаёт LLM состояние интерфейса и предыдущие действия. Чем сложнее страница и длиннее задача, тем больше контекст: модель снова читает элементы страницы, выясняет, где находится, и решает, что делать дальше.

OdoBot сначала записывает успешные демонстрации работы с приложением. Расширение браузера фиксирует клики, ввод данных и выбор элементов, а также события самого приложения: изменение адреса, сетевые запросы, мутации GraphQL и изменения дерева элементов страницы.

Из событий агент строит ориентированный граф. Его вершины обозначают эквивалентные действия и реакции приложения, а рёбра сохраняют их порядок. Например, клики по одной кнопке объединяются, если совпадают путь страницы, XPath элемента и текст кнопки.

LLM описывает каждую записанную траекторию обычным языком и переводит описание в векторное представление. Когда приходит новая задача, OdoBot находит наиболее близкий известный сценарий и выбирает путь по графу. Во время выполнения он сверяет адреса и сетевые события с ожидаемыми без обращения к LLM.

Модель подключается только там, где нужно учесть содержание конкретной задачи: выбрать курс, пункт списка или значение поля. Ей передают не всю страницу, а небольшой фрагмент DOM с подходящими элементами. Архитектура разделяет управление процессом и смысловой выбор: первое выполняет граф, второе — LLM.

Метод проверяли на 45 типах задач в Canvas LMS. Для построения графа и сравнительных запусков использовали разные экземпляры задач; среду сбрасывали между сериями, а всем агентам дали одну и ту же LLM. В набор вошли операции, которые меняют данные на сервере, поэтому успех определяли по сетевым запросам, а не с помощью модели-оценщика.

Меньший контекст сохранил долю выполненных задач

OdoBot успешно завершил 76,4% задач и расходовал в среднем 19,9 тысячи токенов на одну задачу. Agent-E справился с 85,3%, то есть чаще доводил сценарий до конца, но уступил по расходу токенов.

Лучшая конфигурация WebVoyager завершила 72,9% задач. OdoBot превысил этот результат со статистически значимой разницей и потратил на 80% меньше токенов. Снижение разрешения снимков помогало WebVoyager экономить контекст, но одновременно резко ухудшало его способность распознавать элементы интерфейса.

Агенты ошибались по-разным причинам. Agent-E и WebVoyager могли потеряться в навигации, не распознать переключатель или отказаться выполнять учебное задание. OdoBot знал путь из демонстрации, но чаще ломался там, где граф неверно описывал страницу или интерфейс менялся динамически.

Подход окупается на стабильных и частых сценариях

Построение модели поведения потребовало 10,3 миллиона токенов. Экономия относительно Agent-E компенсировала эти затраты после 676 выполненных задач, а относительно WebVoyager — после 120. Для разового запуска предварительная подготовка слишком велика, но у регулярно повторяемой операции появляется понятная точка окупаемости.

Работа меняет планы команд, которые автоматизируют один известный веб-продукт: внутреннюю административную систему, учебную платформу или кабинет оператора. Вместо универсального агента можно заранее записать основные маршруты, вынести контроль процесса из LLM и оставить модели только выбор значений на развилках.

В бюджет придётся заложить сбор успешных демонстраций и обновление графа после изменений интерфейса. OdoBot опирается на XPath, который легко ломается при перестройке страницы. Особенно плохо метод переносит экраны, где разные элементы последовательно появляются в одном месте, как вопросы многостраничной анкеты или теста.

Проверка охватывает одно приложение — Canvas — и сценарии с изменениями на сервере. Она показывает экономию для повторяемой работы в знакомом интерфейсе, но не подтверждает, что тот же графовый подход сохранит результат на открытых сайтах или ранее не встречавшихся задачах.

Практичная схема для продукта — сочетать два режима. Граф ведёт агента по изученным участкам с низким расходом токенов, а обычный веб-агент принимает управление, если наблюдаемое состояние не совпало с известным маршрутом. Сама работа предлагает такое сочетание как направление развития, но не проверяет его экспериментально.

Источники

Иллюстрация: рисунок из статьи «Token Efficient Task Execution via Application Behavior Modeling for Web Agents», Alexandru Ianta, Eleni Stroulia, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу