Журнал · Rit.work

ABCAgent задаёт поведение LLM-агента кодом

Программная логика вместо постоянного управления через LLM снижает расходы на повторяющиеся задачи и делает длинные сценарии устойчивее.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Повторяющиеся задачи LLM-агента удалось запускать без нового обращения к модели для управления каждым шагом. В нерецензированном препринте Uniphore, где все числа получили сами авторы, ABCAgent сократил стоимость повторного решения задач GSM-Symbolic в семь раз. Для продуктовых команд это предлагает другую архитектуру: модель проектирует и исправляет процесс, а обычная программа исполняет его снова.

Программа хранит поведение, а не результат одного запуска

Обычный LLM-агент получает задачу, планирует следующий шаг, вызывает инструмент, читает результат и снова обращается к модели. При изменении входных данных он повторяет всю цепочку. Расходы и задержка растут вместе с числом шагов, а модель может иначе повести себя на почти одинаковых запросах.

ABCAgent разделяет проектирование и исполнение. Модель-проектировщик пишет программу, которая задаёт порядок действий, ветвления, циклы и вызовы инструментов. После проверки эта программа становится источником истины для следующих запусков.

Входные значения не вшиваются в логику. Программа заранее объявляет параметры, поэтому новый запрос можно обработать, подставив другие значения. Если подстановка не подходит, модель редактирует программу и снова проверяет её на уже решённых задачах.

Код не исключает LLM из процесса полностью. Внутри программы могут оставаться нейронные функции для поиска, извлечения данных или разбора неоднозначного запроса. Меняется уровень управления: циклы, состояние и порядок вызовов контролирует программный исполнитель, а модель получает только те операции, где нужна её гибкость.

При создании программы ABCAgent генерирует варианты исходной задачи и проверяет, меняется ли результат вместе с параметрами. Такая проверка ловит программы, которые формально принимают новый ввод, но продолжают использовать значения из первого примера. Состояние хранится в типизированных переменных и областях видимости, а не в растущей текстовой истории.

Преимущество проявилось в повторных запусках и длинных сценариях

ABCAgent сравнивали с нейронным агентом на той же базовой модели и в сопоставимом окружении. Проверки охватили GAIA, изменённые задачи GAIA, WorkArena-CF, GSM-Symbolic, а также телекоммуникационный и авиационный домены τ2-bench. Часть наборов проверяет открытые задачи с инструментами, часть — устойчивость программы к новым параметрам, циклам и ветвлениям.

На GSM-Symbolic ABCAgent решил 98,3% задач против 97,3% у нейронного агента; разница статистически значима, хотя практически невелика. Более заметен разрыв на телекоммуникационных сценариях τ2-bench: по метрике Pass4, которая требует успеха во всей серии повторных запусков, системы получили 71,9% и 47,4% соответственно.

На GAIA и изменённых задачах GAIA точность систем не различалась за пределами погрешности. На WorkArena-CF полная успешность также была сопоставима, но программа правильно записывала больше строк базы данных при любой проверенной длине цикла. В телекоммуникационном домене задержка самого агента сократилась в 9,5 раза.

Эти результаты относятся к тестовым средам и семействам задач, где можно отделить устойчивую процедуру от меняющихся входных данных. GSM-Symbolic сохраняет одну схему рассуждения при замене имён и чисел, WorkArena-CF проверяет циклы и ветвления, а τ2-bench использует симулированных клиентов и заданные правила обслуживания.

Когда подход меняет архитектурный план

Работа влияет на планы команд, которые автоматизируют повторяющиеся процессы с устойчивыми правилами: обработку обращений, заполнение записей или последовательности вызовов инструментов. В такой системе LLM имеет смысл переместить из главного цикла в контур проектирования, разбора неоднозначных данных и исправления сбоев.

Основным артефактом тогда становится не длинная инструкция модели, а проверяемая программа с параметрами. Её можно просматривать перед запуском, тестировать на вариантах задачи и повторно применять без полного планирования. Экономия накапливается по мере повторных запусков, поэтому подход меньше меняет одноразовые исследовательские задачи, где программу не успевают использовать повторно.

Детерминированным становится управление процессом, но не обязательно вся система: встроенный вызов LLM всё ещё может вернуть разные ответы. Границу стоит проводить по операциям. Проверяемые циклы, условия и изменение состояния остаются в коде; поиск смысла в свободном тексте можно оставить модели.

Хранимая программа создаёт и новый риск: ошибка воспроизводится на многих входных данных так же последовательно, как правильное действие. Поэтому проверка на изменённых задачах нужна до сохранения программы, а для действий с существенными последствиями — вместе с просмотром человеком. ABCAgent показывает не замену агентной платформы готовым компонентом, а архитектурный шаблон для процессов, где цена недетерминированного управления уже стала заметной.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу