Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи Qwen Team и Alibaba Group представили Terminal-Universe — способ восстанавливать исполняемые рабочие среды из траекторий терминальных агентов, причём работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, Qwen3.5-27B после дообучения на полученных данных превзошла исходную модель и в одиночных задачах, и в последовательных сессиях. Подход важен командам, которые обучают собственных кодовых агентов и уже накапливают журналы их действий.
Что сделали
Траектория агента — это зафиксированная последовательность запросов, команд, чтения файлов и изменений кода. Обычно её используют как готовый пример поведения для обучения. Авторы предлагают вместо копирования этого поведения восстановить среду, в которой оно возникло, а затем запускать в ней новые решения.
Сначала Terminal-Universe воспроизводит файловые операции в хронологическом порядке. Для каждого пути система берёт самое раннее увиденное состояние файла, то есть версию до правок агента. Созданные агентом файлы и внесённые им изменения исключаются, чтобы задача не оказалась заранее решённой.
Такое воспроизведение неизбежно создаёт неполную рабочую область: в журнал не попадают файлы, которые агент не открывал, скрытые зависимости и часть системного окружения. Отдельный агент дополняет недостающие файлы и зависимости, но не должен реализовывать само решение. Затем модель-оценщик с доступом только на чтение проверяет, достаточно ли восстановленного проекта для выполнения исходного запроса.
На прошедших отбор средах авторы создают несколько видов данных. Система восстанавливает исходную задачу, придумывает новые запросы внутри одного проекта, связывает зависимые рабочие области и продолжает работу через последовательные уточнения от имитируемого пользователя. Для синтезированных задач агент пишет исполняемые тесты, а в обучающий корпус попадают только решения, которые их проходят.
В задачах между проектами целевая рабочая область доступна для записи, а связанный проект — только для чтения. Агенту приходится самостоятельно найти подходящую реализацию и перенести её поведение. В последовательных сессиях требования и состояние проекта сохраняются между раундами, а результаты тестов преобразуются в обычную обратную связь пользователя.
Что показали
Из общедоступных траекторий авторы получили 37,3 тыс. рабочих сред, признанных достаточными для соответствующих задач. Решения для обучающих примеров генерировала Qwen3.7-Max, после чего на них методом обучения с учителем дообучили Qwen3.5-27B.
На Terminal-Bench 2.1 результат исходной модели вырос на 11,9 процентного пункта. На EvoCode-Bench v2 показатель MT@4, отражающий способность выполнять последовательность запросов до первой ошибки, прибавил 13,8 пункта. Это разные режимы проверки: первый оценивает отдельные терминальные задания, второй — продолжительную работу с сохраняющимся проектом.
Отдельный эксперимент показывает, на что полезнее расходовать одинаковый объём генерации данных. Добавление новых сред подняло результат с 53,2 до 56,0, тогда как дополнительные запросы или решения в уже использованных средах дали изменение в пределах погрешности. По интерпретации авторов, разнообразие исполняемого контекста важнее повторного исследования одного проекта.
Ограничения
Восстановленная среда не является точной копией исходной. Неоткрытые файлы, внешние ресурсы и неявные системные зависимости не оставляют следов в траектории, поэтому часть проекта достраивает модель. Все рабочие области запускаются в стандартных контейнерах Ubuntu 24.04 с доступом к сети, а не в специализированных образах конкретных репозиториев. Авторы отмечают, что это может ухудшать воспроизведение проектов со сложной сборкой или особыми системными зависимостями.
Состав данных ограничен доменами, языками и инструментами, встречавшимися в исходных общедоступных траекториях. Основные результаты получены при дообучении одной базовой модели и проверены на Terminal-Bench 2.1 и EvoCode-Bench v2; работа не показывает, сохранится ли тот же прирост для других семейств моделей и производственных репозиториев.
Задачи, решения и проверяющие тесты создаёт один учитель. Ошибка этого учителя может одновременно попасть в решение и остаться незамеченной его же тестами. В проведённом сравнении также нет прямого эксперимента с альтернативными способами построения сред при одинаковых моделях, вычислительном бюджете и исходных данных.
Что это значит
Для команд, использующих готового кодового агента через API, работа не требует пересмотра архитектуры продукта. Она не предлагает новый механизм выполнения команд, изоляции или доступа к репозиториям. Изменение касается подготовки данных после основного обучения модели.
Для разработчиков собственных агентов вывод практичнее: подробные журналы чтения, записи, редактирования файлов и запуска команд можно рассматривать не только как демонстрации, но и как сырьё для восстановления повторно используемых сред. Это меняет требования к сбору траекторий. Полезность журнала зависит от того, насколько полно он фиксирует состояния файлов и действия с инструментами.
Однако строить весь план дообучения вокруг Terminal-Universe пока рано. Результаты подтверждают подход только в описанной авторами конфигурации, а качество среды частично зависит от достраивающего агента и тестов того же учителя. Разумный следующий шаг для команды с накопленными траекториями — проверить восстановление на собственных проектах и отдельно измерить, сколько сред остаются исполняемыми без ручного ремонта. Если эта доля приемлема, подход может сократить объём ручной подготовки окружений и расширить набор проверяемых задач.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



