Журнал · Rit.work

Оптимизацию обвязки LLM-агента стоит начинать с правил управления

Авторы HarnessEvo обнаружили, что полезные изменения обвязки агента могут находиться в одном компоненте, а равное распределение бюджета мешает их найти.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Michael Nguyen и соавторы исследовали, в какой части текстовой обвязки LLM-агента сосредоточена польза от её автоматической оптимизации; работа опубликована как препринт, не проходивший рецензирования. На ALFWorld настройка только правил рефлексии и управления увеличила долю успешно выполненных задач на 11,9 процентного пункта, тогда как настройка всей обвязки не дала статистически значимого улучшения. Результат важен командам, которые оптимизируют поведение агента без дообучения модели и должны распределять ограниченный бюджет прогонов.

Что сделали

Авторы разделили обвязку вокруг замороженной Qwen2.5-7B на четыре части: роль, стратегию выполнения задачи, правила работы с инструментами и форматом, а также рефлексию и управление. Один и тот же рефлексивный оптимизатор поочерёдно менял эти части, а проверки с включением или исключением отдельного компонента показывали его вклад на отложенных заданиях.

При общем бюджете в 64 прогона равное распределение оставляло каждому компоненту четверть ресурсов. По объяснению авторов, этого не хватало оптимизатору, чтобы принять изменение и повторно проверить его: все компоненты сохраняли пустое начальное состояние. Когда бюджет сосредоточили на правилах управления, агент научился избегать повторения безрезультатных действий, открывать закрытые хранилища до извлечения предмета и останавливаться после достижения цели.

Что это значит

Структурирование обвязки само по себе не улучшает агента. Оно полезно как способ определить компонент, связанный с повторяющимися ошибками, после чего бюджет поиска можно направить на него. Перед равномерным распределением прогонов между частями системы стоит проверить минимальный объём, при котором оптимизатор вообще способен принять и оценить изменение.

Ограничения. Авторы проверяли один замороженный базовый вариант модели и один рефлексивный оптимизатор только на ALFWorld и WebShop. Отложенные наборы включали 134 и 80 заданий соответственно; на WebShop полезного компонента найти не удалось. Работа не показывает, сохранится ли локализация на моделях другого масштаба, в производственных процессах или при иной схеме разбиения обвязки. В сравнении также нет других оптимизаторов, которые могли бы иметь иной минимальный рабочий бюджет.

Источники

Иллюстрация: рисунок из статьи «Where Does Harness-Optimization Value Live? Localized Gains and the Budget-Splitting Trap in Self-Evolving LLM Agents», Michael Nguyen, Wei Chen Tan, Nurul Aisyah Hassan и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу