Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Оптимизатор научили улучшать не только обвязку ИИ-агента, но и собственный процесс поиска и проверки правок. В нерецензированном препринте MIT и Amazon, где все числа получили сами авторы, лучшая конфигурация решила 37,7% новых задач против 29,3% у сильнейшего базового метода. Для разработки агентов это сдвигает внимание с очередного переписывания подсказок на инфраструктуру, которая воспроизводит сбои и проверяет исправления до их принятия.
Оптимизатор меняет собственные инструменты
Обвязка агента задаёт системные подсказки, доступные инструменты, память и порядок действий. Обычно LLM-оптимизатор читает неудачные траектории агента-исполнителя, предлагает правку к этой обвязке и узнаёт результат лишь после следующего цикла оценки. При этом собственные инструкции и средства диагностики оптимизатора остаются неизменными.
VERSE добавляет внешний цикл. Внутренний цикл по-прежнему меняет обвязку исполнителя, а внешний позволяет оптимизатору переписывать собственные подсказки, инструкции, инструменты, автоматические проверки и заметки. Веса обеих моделей остаются замороженными: метод меняет программную среду вокруг них, а не обучает LLM заново.
Сначала VERSE сокращает неудачную траекторию до шагов, которые всё ещё воспроизводят исходную ошибку. Медианная траектория уменьшилась со 129 шагов до 8. Такой фрагмент проще анализировать: оптимизатору не приходится искать причину среди длинной последовательности корректных действий.
Затем он может проверить три разных предположения. Запуск черновой обвязки показывает, исправляет ли она выбранную задачу; повтор траектории подтверждает, что сбой воспроизводится; удаление или замена подозрительного шага проверяет, действительно ли ошибка зависит от него. Успешный результат подтверждают повторным прогоном, чтобы случайное прохождение тестов не считалось исправлением.
Отдельный журнал хранит историю изменений. Он показывает, какие классы ошибок исчезли, какие вернулись и какие прежние исправления сломались после новой правки. Между циклами оптимизатор использует этот журнал, чтобы менять уже собственный порядок работы.
Проверка отделила полезные правки от убедительных
В контролируемом опыте самоизменение без запуска черновых правок не улучшило исходную обвязку: проверка на валидационных задачах каждый раз выбирала начальный вариант. Когда оптимизатор получил возможность исполнить правку перед отправкой, точность достигла 41,05% и стала лучшей среди конфигураций этого опыта.
В основном сравнении VERSE добавили к четырём существующим оптимизаторам обвязки. Лучший выбранный вариант решил 42,3% отложенных задач SWE-rebench против 39,2% у сильнейшей базовой системы. На более новых задачах из репозиториев на нескольких языках разрыв вырос: 37,7% против 29,3%.
Результат объясняет, почему одного анализа журналов недостаточно. Правка может звучать правдоподобно, но не устранять сбой, исправлять только конкретный пример или ломать уже работающий сценарий. Если оптимизатор записывает такой вывод в собственную память, ошибка влияет и на следующие циклы. Исполнение превращает предположение в проверяемую гипотезу до того, как оно станет правилом.
Командам нужна среда проверки, а не автономное самоулучшение
VERSE не предлагает агенту бесконтрольно переписывать себя. Неизменными остаются правила оценки, бюджеты запусков и механика выбора итоговой обвязки. Самописный код оптимизатора загружается только после проверки безопасности и тестового запуска, а встроенные средства воспроизведения и проверки он удалить не может.
Для продуктовой команды практический вывод состоит в том, что оптимизацию агента стоит строить вокруг исполнимых критериев. Нужны воспроизводимые задачи, автоматические тесты результата, сохранённые траектории, возможность повторить отдельный сбой и журнал регрессий. Без такой среды внешний цикл будет накапливать объяснения, но не сможет надёжно отличить полезное правило от случайного совпадения.
Работу проверяли на задачах исправления кода: обвязки развивали на Python-репозиториях, затем оценивали на отдельном выпуске SWE-rebench и на более новых задачах на пяти языках. VERSE сравнивали с четырьмя оптимизаторами по общему протоколу, при раздельных наборах для развития, выбора и финальной проверки. Поэтому результат поддерживает архитектуру для агентов с автоматически проверяемым исходом, но сам по себе не показывает такой же эффект в процессах, где качество оценивает человек или результат проявляется только спустя время.
Менять планы ради отдельного алгоритма пока рано. Но если команда уже строит систему автоматического улучшения подсказок и инструментов, в план стоит добавить проверку черновых правок, воспроизведение сбоев и выбор версии на отдельном наборе задач. Именно эти компоненты в работе отделили самоизменение, которое ухудшало систему, от самоизменения, которое повысило точность.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



