Журнал · Rit.work

Как переносить удачные траектории ИИ-агента из специальных контуров в общий

Recursive Self-Rewrite превращает решения, найденные агентом с внешней поддержкой, в проверенные данные для дообучения под обычный контур запуска.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Удачные решения ИИ-агента в специализированных контурах управления можно переписать так, чтобы модель освоила их и затем работала без прежней внешней поддержки. В препринте Zongxia Li и соавторов, который не проходил рецензирование и все числа в котором получили сами авторы, Recursive Self-Rewrite превратил 2 001 исходную успешную траекторию в 11 094 проверенных примеров для дообучения. Для команд это способ использовать сложные контуры как среду сбора опыта, не перенося их целиком в продукт.

Почему нельзя просто дообучить модель на удачных запусках

Контур управления агентом задаёт, как модель получает наблюдения, вызывает инструменты, хранит состояние, проверяет промежуточный результат и решает, когда остановиться. Одна и та же модель поэтому ведёт себя по-разному в Terminus 2, StateM и Recursive Self-Reflect Terminus.

Различия оказались полезны при поиске решений. Объединение результатов всех контуров дало на 34,3% больше решённых задач, чем лучший отдельный контур. Один поддерживал обычный диалог с терминалом, другой фиксировал этапы процесса и разрешал переход только после проверки, третий возвращал модель к работе после неудачной итоговой проверки.

Но успешная траектория содержит не только полезные действия модели. В неё попадают служебные подсказки, правила продолжения, сообщения контроллера и соглашения конкретного контура. После прямого дообучения модель может начать рассчитывать на сигналы, которых не будет в целевой среде.

Эксперименты проводили с Qwen-3.8-27B на примерно 3 тысячах терминальных задач из программирования, естественных наук, работы с оборудованием, эксплуатации и безопасности. Целевой средой служил общий контур Terminus 2, а результат сравнивали с исходной моделью и прямым контролируемым дообучением на собранных траекториях.

Как RSR отделяет способ решения от внешнего управления

Recursive Self-Rewrite не редактирует исходный журнал действий построчно. Система сначала извлекает из него процедуру, а затем просит модель заново выполнить задачу в чистой среде. Так новая траектория отражает работу под целевым контуром, а не имитацию старого контроллера.

На первом этапе планировщик удаляет служебные сообщения и составляет пошаговый регламент. В нём остаются требуемый итог, ключевые этапы, проверки, способы восстановления после ошибки и типичные тупики. Готовый результат переносить в регламент нельзя: исполнитель должен получить метод, а не ответ.

Затем модель-критик видит только публичное условие задачи и подготовленный регламент. Она отбрасывает варианты, которые раскрывают скрытую проверку, содержат части готового решения или ссылаются на недоступные инструменты. Неудачный вариант создаётся заново с учётом замечаний критика — отсюда рекурсивная часть метода.

Исполнитель получает прошедший проверку регламент и решает исходную задачу в новом изолированном окружении под Terminus 2. В обучающий набор попадают только запуски, которые прошли автоматическую проверку. Сам регламент и разговор с критиком удаляют, поэтому модель обучается на обычной истории команд, ответов среды и собственных действий.

Этот шаг отличает RSR от очистки журналов. Удалить управляющие сообщения недостаточно: оставшиеся действия всё ещё могли зависеть от состояния старого контура. Повторное решение проверяет, что процедуру можно воспроизвести в той среде, где дообученная модель будет работать.

Когда подход меняет план разработки агента

На Terminal-Bench 2 доля задач, решённых хотя бы в одном из трёх запусков, достигла 74,2% — на 20,8 процентного пункта выше прямого дообучения. На собственном Terminal-Bench Hard результат составил 63%, что дало преимущество в 7 процентных пунктов. Улучшилась и оценка промежуточного прогресса на длинных задачах, хотя она не перешла в полностью завершённые решения.

Работа меняет план сбора данных, если команда уже экспериментирует с несколькими агентными контурами. Их не обязательно сводить к одному до начала обучения: каждый можно использовать для поиска своего класса успешных решений, а затем воспроизвести эти решения под целевой средой.

При этом сырые журналы не стоит объединять напрямую. Практический конвейер должен выделять процедуру, проверять её на утечки, запускать задачу заново и сохранять только подтверждённый результат. Для этого нужны изолированные окружения и автоматический проверяющий механизм; без них RSR теряет основной фильтр качества.

Специализированный контур в такой схеме становится инструментом подготовки данных, а не обязательной производственной зависимостью. Это позволяет применять более сложное управление во время поиска решений, но оставить в продукте общий и предсказуемый способ запуска агента.

Переносимость результата пока подтверждена для одной модели и терминальных задач с исполняемой проверкой. Поэтому работа даёт основание пересмотреть конвейер дообучения терминальных и программных агентов, но не доказывает тот же эффект для процессов, где итог нельзя автоматически проверить в свежем окружении.

Источники

Иллюстрация: рисунок из статьи «Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite», Zongxia Li, Yucheng Shi, Zhongzhi Li и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу