Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Авторы из Hunyuan Team и Tencent представили Environment Evolution — подход к подготовке усложняющихся сред для обучения терминальных агентов; работа опубликована как препринт, не проходивший рецензирования. По их замерам, метод оказался эффективнее объединения сред и совместной эволюции агента со средой. Результаты важны командам, которые обучают агентов работать с командной строкой и уже упираются в недостаток сложных проверяемых задач.
Что сделали
Терминальная среда здесь состоит из изолированной программной системы, задания для агента и автоматической проверки результата. Такие среды нужны для обучения с подкреплением: агент выполняет команды, получает проверяемую награду и постепенно осваивает многошаговые задачи.
Проблема обычного синтеза в том, что сильная модель может стабильно решать полученные задания. Тогда все траектории заканчиваются одинаково успешно и среда перестаёт показывать, какое действие было лучше. Совместная эволюция агента и среды пытается исправить это, создавая задания вокруг ошибок текущей модели, но привязывает набор задач к её конкретным слабостям.
Авторы вместо этого усложняют саму среду вне стратегии обучаемой модели (off-policy). Они выделяют три направления:
- Новизна сценария. Знакомый навык требуется применить в менее типичной системе или ситуации.
- Редкость навыка. В прежнем сценарии появляется действие, которое реже встречается в подобных задачах.
- Длина исполнения. В решение добавляются зависимости и промежуточные этапы.
Каждое новое поколение строится из последней принятой среды. Сначала агент-проектировщик описывает ожидаемую последовательность сценариев и навыков, меняет её в выбранном направлении и отправляет план агенту-рецензенту. После принятия плана другой агент модифицирует файлы, инструкцию и систему проверки.
Получившаяся среда проходит несколько проверок. Эталонное решение должно завершить задачу, пустое действие — провалить её, а отдельная модель-оценщик проверяет общие требования к качеству. Во время разработки авторы также проводили ручную проверку и превращали найденные дефекты в новые правила для автоматических оценщиков.
Среды объединяются в последовательные поколения. Планировщик обучения начинает с ранних вариантов и переходит дальше, когда агент успешно выполняет текущую задачу в шести из восьми прогонов. Это должно сохранять частично решаемые группы попыток, по которым обучение с подкреплением получает различимый сигнал.
Что показали
Авторы проверили сложность сред с помощью Hy4 preview, Claude Opus 5 и GPT-5.6 Sol. По их измерениям, последовательное усложнение снижало долю успешно выполненных заданий и увеличивало требуемое число шагов у всех трёх моделей. Наиболее широкий объём изменений быстрее доводил среды до режима, в котором модели не решали ни одного задания, поэтому для основного эксперимента выбрали более контролируемый промежуточный режим.
После обучения Qwen3.6-27B результат на Terminal-Bench 2.1 вырос на 14,4 процентного пункта, а Qwen3.6-35B-A3B — на 18,0 процентного пункта. Terminal-Bench проверяет, способен ли агент выполнить воспроизводимые задачи в терминале. Для первой модели пиковая точность Environment Evolution составила 71,5% против 62,9% у совместной эволюции агента и среды; объединение нескольких исходных сред дало более слабый результат.
Ограничения
Работа проверяет подход на двух вариантах Qwen и одном типе агентов — работающих через Claude Code с командной строкой. Обучающие линии построены из 500 отобранных исходных сред и ограничены 15 поколениями. Поэтому эксперименты не показывают, сохранится ли эффект для агентов, управляющих графическим интерфейсом, специализированных агентов разработки или моделей другого семейства.
Для синтеза во всех сравниваемых подходах использовался Claude Opus 5. Это выравнивает эксперимент, но не позволяет отделить свойства метода от возможностей выбранной модели-синтезатора. Авторы сравнивают подход с объединением сред и совместной эволюцией, однако не приводят сопоставления затрат на генерацию, автоматическую проверку и ручную доработку. Также работа оценивает итог на одном внешнем бенчмарке и не показывает влияние на производственные задачи с собственными репозиториями, правами доступа и требованиями к безопасности.
Что это значит
Для команд, которые только подключают готовую модель к терминалу, работа не меняет ближайший план: она не предлагает новую архитектуру агента и не улучшает выполнение без дополнительного обучения. Практический эффект начинается там, где есть собственный цикл постобучения и запас исполняемых сред с эталонными решениями.
В таком проекте результаты поддерживают переход от плоского набора задач к версиям одной среды с прослеживаемым усложнением. Наиболее переносимая часть работы — не конкретные агенты-проектировщики, а устройство конвейера: отдельно планировать изменение, отдельно модифицировать среду, проверять успешное и заведомо неверное решение, а затем выдавать поколения по мере роста агента.
Подход также снижает зависимость генерации среды от прогонов текущей обучаемой модели. Это может упростить повторное использование одной линии задач для нескольких моделей. Но закладывать заявленный прирост в план продукта рано: сначала потребуется проверить, окупает ли создание эталонных решений, изоляция исполнения и контроль качества сред выигрыш на внутренних задачах. Работа скорее меняет план построения обучающей инфраструктуры, чем выбор базовой LLM.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



