Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Удачные решения ИИ-агента в специализированных контурах управления можно переписать так, чтобы модель освоила их и затем работала без прежней внешней поддержки. В препринте Zongxia Li и соавторов, который не проходил рецензирование и все числа в котором получили сами авторы, Recursive Self-Rewrite превратил 2 001 исходную успешную траекторию в 11 094 проверенных примеров для дообучения. Для команд это способ использовать сложные контуры как среду сбора опыта, не перенося их целиком в продукт.
Почему нельзя просто дообучить модель на удачных запусках
Контур управления агентом задаёт, как модель получает наблюдения, вызывает инструменты, хранит состояние, проверяет промежуточный результат и решает, когда остановиться. Одна и та же модель поэтому ведёт себя по-разному в Terminus 2, StateM и Recursive Self-Reflect Terminus.
Различия оказались полезны при поиске решений. Объединение результатов всех контуров дало на 34,3% больше решённых задач, чем лучший отдельный контур. Один поддерживал обычный диалог с терминалом, другой фиксировал этапы процесса и разрешал переход только после проверки, третий возвращал модель к работе после неудачной итоговой проверки.
Но успешная траектория содержит не только полезные действия модели. В неё попадают служебные подсказки, правила продолжения, сообщения контроллера и соглашения конкретного контура. После прямого дообучения модель может начать рассчитывать на сигналы, которых не будет в целевой среде.
Эксперименты проводили с Qwen-3.8-27B на примерно 3 тысячах терминальных задач из программирования, естественных наук, работы с оборудованием, эксплуатации и безопасности. Целевой средой служил общий контур Terminus 2, а результат сравнивали с исходной моделью и прямым контролируемым дообучением на собранных траекториях.
Как RSR отделяет способ решения от внешнего управления
Recursive Self-Rewrite не редактирует исходный журнал действий построчно. Система сначала извлекает из него процедуру, а затем просит модель заново выполнить задачу в чистой среде. Так новая траектория отражает работу под целевым контуром, а не имитацию старого контроллера.
На первом этапе планировщик удаляет служебные сообщения и составляет пошаговый регламент. В нём остаются требуемый итог, ключевые этапы, проверки, способы восстановления после ошибки и типичные тупики. Готовый результат переносить в регламент нельзя: исполнитель должен получить метод, а не ответ.
Затем модель-критик видит только публичное условие задачи и подготовленный регламент. Она отбрасывает варианты, которые раскрывают скрытую проверку, содержат части готового решения или ссылаются на недоступные инструменты. Неудачный вариант создаётся заново с учётом замечаний критика — отсюда рекурсивная часть метода.
Исполнитель получает прошедший проверку регламент и решает исходную задачу в новом изолированном окружении под Terminus 2. В обучающий набор попадают только запуски, которые прошли автоматическую проверку. Сам регламент и разговор с критиком удаляют, поэтому модель обучается на обычной истории команд, ответов среды и собственных действий.
Этот шаг отличает RSR от очистки журналов. Удалить управляющие сообщения недостаточно: оставшиеся действия всё ещё могли зависеть от состояния старого контура. Повторное решение проверяет, что процедуру можно воспроизвести в той среде, где дообученная модель будет работать.
Когда подход меняет план разработки агента
На Terminal-Bench 2 доля задач, решённых хотя бы в одном из трёх запусков, достигла 74,2% — на 20,8 процентного пункта выше прямого дообучения. На собственном Terminal-Bench Hard результат составил 63%, что дало преимущество в 7 процентных пунктов. Улучшилась и оценка промежуточного прогресса на длинных задачах, хотя она не перешла в полностью завершённые решения.
Работа меняет план сбора данных, если команда уже экспериментирует с несколькими агентными контурами. Их не обязательно сводить к одному до начала обучения: каждый можно использовать для поиска своего класса успешных решений, а затем воспроизвести эти решения под целевой средой.
При этом сырые журналы не стоит объединять напрямую. Практический конвейер должен выделять процедуру, проверять её на утечки, запускать задачу заново и сохранять только подтверждённый результат. Для этого нужны изолированные окружения и автоматический проверяющий механизм; без них RSR теряет основной фильтр качества.
Специализированный контур в такой схеме становится инструментом подготовки данных, а не обязательной производственной зависимостью. Это позволяет применять более сложное управление во время поиска решений, но оставить в продукте общий и предсказуемый способ запуска агента.
Переносимость результата пока подтверждена для одной модели и терминальных задач с исполняемой проверкой. Поэтому работа даёт основание пересмотреть конвейер дообучения терминальных и программных агентов, но не доказывает тот же эффект для процессов, где итог нельзя автоматически проверить в свежем окружении.
Источники
Иллюстрация: рисунок из статьи «Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite», Zongxia Li, Yucheng Shi, Zhongzhi Li и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



