Журнал · Rit.work

BCO сохраняет гипотезы оптимизирующего агента между итерациями

Авторы BCO предлагают хранить гипотезы об ошибках LLM-агента в отдельном документе и корректировать их после каждого изменения программной обвязки.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Yuhan Chen и соавторы представили BCO — способ итеративно улучшать программную обвязку LLM-агента, говорится в препринте, который не проходил рецензирования. По замерам авторов, BCO обошёл контрольный метод на всех пяти отложенных выборках. Работа важна командам, которые оптимизируют подсказки, маршрутизацию инструментов, память и управляющий код вокруг неизменяемой модели.

Что сделали

Программная обвязка агента, или scaffold, — это код и инструкции вокруг LLM: цикл вызовов, доступные инструменты, память, обработка контекста и правила формирования ответа. Если сама модель доступна только через API и её параметры нельзя менять, улучшать продукт приходится именно через эту обвязку.

Обычный оптимизирующий агент читает оценки и трассы выполнения, находит предполагаемую причину ошибки и редактирует исходный код. На следующей итерации ему снова доступны исходники, оценки и трассы, но выводы, на которых основывалось предыдущее изменение, остаются внутри прошлого вызова. Агенту приходится заново восстанавливать картину по необработанной истории.

BCO выносит эту картину в постоянный Markdown-документ, который авторы называют моделью мира. В нём записываются проверяемые гипотезы о поведении агента и оценочной системы: при каких условиях возникает проблема, насколько агент уверен в объяснении, какие наблюдения его поддерживают или опровергают и какие изменения уже проверялись.

Перед изменением оптимизатор фиксирует ожидаемый эффект для определённой группы задач. После запуска он сопоставляет прогноз с фактическим результатом и обновляет только связанные с ним гипотезы: добавляет новые, пересматривает существующие, объединяет дублирующиеся или удаляет опровергнутые. История изменений остаётся в документе, поэтому неудачный эксперимент не должен повторяться без новой причины.

Авторы различают гипотезы о выполнении и об оценивании. Первые описывают, как изменение кода повлияет на поведение агента. Вторые фиксируют случаи, когда оценочная система может ненадёжно связывать траекторию выполнения с итоговым баллом. Таким образом, оптимизатор учитывает не только ошибки продукта, но и шум измерения.

Что показали

Авторы сравнили BCO с контрольным циклом, который получал те же исходники, изменения, оценки и трассы, но не имел постоянного документа с гипотезами. Неизменяемая целевая модель, начальная обвязка, набор задач, бюджет итераций и модель, редактирующая код, внутри каждой пары совпадали.

На отложенных выборках преимущество BCO над контролем составило от 2,2 до 15,2 процентного пункта. Нижняя граница получена на терминальных задачах, верхняя — на GAIA, где агент должен рассуждать, пользоваться инструментами и работать с разными типами входных данных. Авторы измерили преимущество на задачах долговременной памяти, вызова инструментов, управления приложениями через код и работы в командной строке.

Дополнительная проверка касалась содержания документа. Новая модель-предсказатель точнее прогнозировала последствия изменений, когда получала накопленную модель мира, чем без неё или с документом той же формы, но с намеренно искажёнными утверждениями. По интерпретации авторов, полезен не сам шаблон заметок, а записанные в нём выводы.

При замене целевой LLM выбранные BCO-обвязки также чаще лидировали на проверенных задачах. Исключением стали запуски, где увеличившееся потребление контекста не позволяло агенту завершить работу: на полном наборе AppWorld это ухудшало итог относительно сравнения только по завершённым задачам.

Ограничения

Проверка охватывает обучающие наборы размером от 20 до 100 заданий и отложенные выборки от 66 до 1449 заданий. Для каждого метода на каждом бенчмарке проведена одна траектория оптимизации, поэтому работа показывает согласованное направление между задачами, но не устойчивость результата при повторных запусках на одном и том же наборе.

Для двух задач памяти авторы выбирали лучший результат из трёх ведущих кандидатов на отложенной выборке. Эта выборка поэтому частично участвовала в выборе итоговой обвязки, а оценка переноса для этих задач менее строгая, чем там, где проверялся единственный кандидат.

Основное сравнение проведено с циклом без постоянного состояния. В приложении есть диагностический вариант со свободными заметками между итерациями, однако разброс его запусков не позволил установить, превосходит ли BCO обычную память агента. Работа также не показывает, что метод стабильно снижает вычислительные расходы: в одних средах документ сокращал повторное чтение истории, в других добавлял затраты на запись и контекст.

Модель мира остаётся текстовым резюме, созданным LLM, а не статистически откалиброванной вероятностной моделью. Протокол предполагает, что среда внутри запуска не меняется. Смена модели, инструментов или их поведения требует обнаруживать сдвиг и уменьшать вес старых наблюдений, но такого механизма в BCO нет.

Что это значит

Работа не требует менять планы командам, которые используют готовую обвязку и не проводят систематическую оптимизацию по оценочному набору. BCO добавляет ценность только там, где уже существует повторяемый цикл: изменение кода, запуск набора задач, сбор трасс и выбор следующего кандидата.

Для таких команд результат предлагает практическое изменение архитектуры оптимизатора: хранить не только журнал запусков, но и отдельное состояние процесса с проверяемыми гипотезами, прогнозами и опровержениями. Это может уменьшить повторное исследование прежних ошибок и сделать решения агента проверяемыми после завершения отдельного вызова.

Перестраивать производственную систему вокруг BCO по этой работе рано. Разумный следующий шаг — добавить подобный документ в существующий контур экспериментов и сравнить его с более простыми постоянными заметками при нескольких независимых запусках. Отдельно потребуется ограничить размер документа и определить, когда накопленные выводы устаревают после смены модели или внешних инструментов.

Источники

Иллюстрация: рисунок из статьи «Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization», Yuhan Chen, Zhihua Tian, Mahavir Dabas и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу