Журнал · Rit.work

EvoSteer чинит граф LLM-агентов до завершения задачи

EvoSteer перестраивает команду агентов во время работы, оценивает вклад каждого действия и допускает новые навыки только после парного теста.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

EvoSteer научился перестраивать команду LLM-агентов прямо во время выполнения задачи: повторять неудачный узел, удалять его и менять связи, не дожидаясь финального провала. На тестах он обошёл сильнейший базовый метод на 4,01 процентного пункта по доле верных ответов, хотя работа не рецензирована и числа в ней получили сами авторы. Для команд, которые строят изменяемые графы агентов, адаптация становится частью одного запуска, а не отдельным циклом после серии ошибок.

Граф меняется после каждого выполненного действия

Обычная самообучающаяся оркестрация меняет роли, подсказки и связи между агентами после завершения задачи. Если промежуточный ответ выглядит правдоподобно, но ведёт к ошибке, система продолжает работу с неверно собранной командой и исправляет её только в следующем запуске.

EvoSteer чередует изменение графа с исполнением. Оркестратор может добавить агента или связь, назначить навык, выбрать итоговый узел, повторно запустить агента, удалить его либо завершить задачу. Каждое действие выполняется сразу, а результат попадает в историю, на которой выбирают следующий шаг.

Решение опирается не только на текст ответа. Среда формирует вектор из 30 признаков: размер графа, тип последнего действия, результат исправления, согласие агентов, расход бюджета и другие свойства исполнения. Отдельная небольшая модель оценивает, с какой вероятностью продолжение от текущего состояния даст правильный итог.

Оркестратор видит эту оценку и её изменение после последнего шага. Если проверяющий агент обнаружил проблему, а ожидаемое качество упало, система может вернуть его замечание решающему агенту и повторить вычисление. Построение команды, исправление и остановку обучает одна политика с общим бюджетом.

AnchorTB распределяет ответственность между шагами

Итоговая награда плохо объясняет, какое действие сломало процесс. Если одинаково приписать её добавлению агента, выбору связи и повторному запуску, оркестратор не отличит ошибочную структуру от сложной задачи, которую редко решает даже эталонная политика.

AnchorTB сравнивает вероятность каждого выполненного действия с вероятностью того же действия у замороженной эталонной политики. Эталоном служит та же базовая модель без обучаемой добавки, поэтому сравнение не смешивает изменение оркестрации со сменой исполнителя.

Метод рассматривает все непрерывные отрезки траектории. Для каждого отрезка он проверяет, согласуются ли действия с оценкой состояния в его начале и конце. Вклад конкретного действия складывается из ошибок всех отрезков, которые через него проходят: ранний неверный выбор не получает тот же сигнал, что и полезное исправление ближе к финалу.

Оценку состояния привязывают к измеренной успешности эталонной политики на текущей задаче, а затем поправляют с учётом уже построенной части графа. Это разделяет два случая: низкий ожидаемый результат из-за сложности самой задачи и падение результата после неудачного изменения команды.

Новые навыки проходят отдельную проверку, но используют тот же эталон. Система запускает пару сопоставимых траекторий: в одной кандидат доступен, в другой скрыт; задача, среда и первая роль совпадают. Последовательный статистический тест накапливает победы и поражения, после чего навык повышают до постоянного, отклоняют или оставляют на проверке. Уже принятый навык можно вывести из библиотеки, если последующие пары показывают обратный эффект.

Планы меняются для систем с дорогими промежуточными ошибками

Работа предлагает не новый шаблон графа, а архитектуру исполнения. Граф должен оставаться изменяемым во время задачи, среда — возвращать структурированные признаки после каждого действия, а повторный запуск и удаление агента — входить в обычное пространство решений. Если команда сейчас сначала строит весь процесс, а затем исполняет его целиком, внедрение потребует переделать сам цикл оркестрации.

Подход также добавляет контур обучения: замороженную эталонную политику, оценку продолжения, парные прогоны для навыков и хранение полной истории. Это оправдано там, где промежуточный ответ может выглядеть корректно, но поздно обнаруженная ошибка делает бесполезным весь запуск. Для коротких процессов с одним вызовом модели исследование не показывает сопоставимого преимущества.

Метод проверяли на вопросах и ответах, математике, генерации кода и интерактивном принятии решений, сравнивая с поиском графов, обучением оркестратора с подкреплением и развитием библиотек навыков. Обученную политику без изменений перенесли на шесть других исполнителей, и она улучшила все 72 сочетания исполнителя и теста.

AnchorTB потребовал на 28% меньше вычислений для обновления, чем ближайший вариант балансировки траекторий; стоимость самих прогонов отличалась от PPO и GRPO не более чем на 9%. Проверка проходила на ограниченных тестовых задачах с общим бюджетом исполнения, поэтому результат подтверждает качество решений оркестратора в этой постановке, но не надёжность длительных производственных процессов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу