Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Накопленный опыт агента можно применять не ко всему следующему заданию, а к конкретному шагу, на котором он нужен. В препринте, который не проходил рецензирование и где все числа получили сами авторы, EvoCUE повысил успешность минимального агента в AppWorld с 13,7% до 79,2%, не меняя модель и инструменты. Для команд, которые строят длинные цепочки вызовов LLM и API, это переносит обучение на уровень логики управления.
Урок прикрепляют к переходу между шагами
Обычная память агента хранит прошлый опыт в системной инструкции, подборке похожих случаев или общей рефлексии. Но полезное правило может появиться в контексте слишком рано или вмешаться в решения, к которым не относится.
В примере из работы агент бронирует поездку и оплачивает дорогой билет без обязательного согласования. Правило «сначала получить одобрение» должно влиять на решение об оплате, а не на поиск рейса или заполнение отчёта. Само наличие правила в памяти ещё не гарантирует, что модель увидит его в нужный момент.
EvoCUE представляет работу агента как конечный автомат. Его узлы вызывают модель или инструмент, а переходы определяют следующий шаг. Правку можно прикрепить к отдельному переходу: она сработает при первом входе в узел, при каждом повторном входе либо перед конкретным действием.
Из завершённого выполнения система выделяет остаточные цели — требования задания, выполнение которых не видно в истории. Если файл уже отправлен, но согласование не зафиксировано, остаточная цель указывает на пропущенную проверку перед отправкой. На её основе EvoCUE предлагает локальную инструкцию или короткий исполняемый навык.
Правка также получает условие применимости. Оно использует наблюдаемое состояние процесса: этап выполнения, наличие подготовленного действия, прогресс по задаче или видимые признаки завершения. Поэтому одно правило не обязано попадать в контекст на каждом шаге.
Эффект правки измеряют с одной контрольной точки
Полный повтор задания плохо показывает пользу локального изменения. Агент может иначе выполнить ранние шаги, получить другие ответы инструментов и прийти к иному результату ещё до места, где должна сработать новая инструкция.
EvoCUE сохраняет состояние непосредственно перед изменяемым переходом — контрольную точку (checkpoint). Затем система дважды продолжает одно и то же выполнение: сначала с исходным контроллером, затем с исправленным. Обе ветки получают одинаковую историю, состояние среды и оставшийся бюджет, поэтому разница в конечной оценке лучше отражает последствия правки.
Сравнение учитывает весь остаток процесса, а не только ближайшее действие. Инструкция может изменить следующий вызов инструмента, а тот — маршрутизацию и дальнейшие решения. Если место не достигнуто, правило не применилось или выполнение завершилось с ошибкой, EvoCUE записывает это отдельно и не смешивает с обычным неуспехом задачи.
Прошедшие такую проверку изменения собирают в новый контроллер. Затем его испытывают на отдельных заданиях, которые не участвовали в подборе правки. Только после этого изменение наследуют следующие запуски; неудачное подтверждение оставляет прежнюю программу.
Подход требует среды, где можно восстановить состояние агента и внешних инструментов. Если API необратимо отправляет письмо, проводит платёж или меняет производственную базу, парное продолжение придётся выполнять в симуляции либо на копии среды. Без восстановления состояния главное преимущество метода — сравнение при общем прошлом — исчезает.
Когда локальные правки меняют архитектурный план
В AppWorld одна и та же инструкция о правильном завершении задачи решила 5 заданий при показе только на первом шаге и 14 из 16, когда попадала в повторяющийся шаг подготовки действий. Это отделяет качество текста от места его применения: ранняя инструкция почти не помогла, хотя оставалась содержательно верной.
На PAST-Bench агент переносил в следующие офисные задачи организационные требования, например необходимость согласовать экспорт данных. Итоговая оценка выросла на 0,164, а прирост оказался в 2,6 раза больше лучшего результата адаптированных GEPA, AFlow, AWM и MaAS. В дополнительных доменах с короткими заданиями или уже сильным начальным контроллером EvoCUE не принял обновлений.
Работу проверяли прежде всего там, где задания состоят из длинных последовательностей действий, а правила из прошлых эпизодов должны влиять на определённый этап. Изученные правки ограничены инструкциями и короткими навыками; программы после обучения замораживали, поэтому накопление большого числа изменений в постоянном потоке задач пока не проверено.
Командам с единым агентским циклом и общей памятью не обязательно сразу менять модель. Практический первый шаг — сделать явными узлы выполнения, переходы и точки восстановления, а затем проверить, зависит ли результат от места подачи уже известных правил. Если зависит, контроллер становится отдельным обучаемым слоем между LLM и инструментами.
Для коротких запросов такая архитектура добавит состояние, журналирование и повторные запуски без показанной пользы. Для процессов с согласованиями, оплатами, изменением записей и повторяющимися проверками работа даёт более конкретный план: хранить опыт не только как текст, но и как правку с адресом, условием запуска и результатом парного испытания.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



