Журнал · Rit.work

T1: как стабилизировать обучение терминального агента на сотнях шагов

T1 показывает, как точные токены, повтор маршрутов MoE и награда от проверок помогают обучать терминальных агентов на длинных задачах.

Rit.work
Студия разработки
11 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель T1 научили надёжнее выполнять длинные задачи в командной оболочке: исправлять код, настраивать окружение и проверять итоговое состояние машины. Команда Junyao Yang подняла долю решённых задач Terminal-Bench 2.1 с 49,4% до 64%, хотя работа не рецензирована и числа в ней получили сами авторы. Результат показывает, что при обучении таких агентов важно контролировать не только награду, но и расхождения между генерацией траектории и последующим обновлением модели.

Почему длинная траектория ломает обучение

T1 построена на Qwen3.5-122B-A10B — разреженной модели на 122 млрд параметров. Агент работает в облачной песочнице и может продолжать задачу более 300 обращений к инструментам: вводить команды, читать вывод, менять файлы и возвращаться после ошибки.

Обучение с подкреплением использует уже выполненные траектории. Управляющая модель выбирает действия, а модель ценности оценивает, к какому результату они приведут. Чтобы корректно обновить параметры, обучающая система должна воспроизвести именно ту последовательность токенов и те части модели, которые участвовали в генерации.

В длинном диалоге это условие легко нарушить. Агентская оболочка сохраняет ответ как текст, добавляет вывод инструмента и заново собирает историю. После декодирования и повторного разбиения текста на токены границы могут измениться, поэтому модель обучается уже не на той последовательности, которую сгенерировала.

У разреженной модели появляется второй источник расхождения. Для каждого токена маршрутизатор выбирает 8 экспертов из 256. Небольшая разница между вычислительными ядрами генератора и обучающей системы может изменить выбор, после чего градиент обновит не те параметры, которые породили действие.

TITO и R3 сохраняют поведение исходной модели

TITO передаёт в обучение точные идентификаторы токенов от генератора, а не восстанавливает их из текста. Отдельные ходы сшиваются в одну последовательность; ответы инструментов остаются контекстом, но не участвуют в расчёте ошибки. Исправлять разрывы разрешено только на скрытых участках, которые не получают градиент.

R3 решает проблему маршрутизации. Во время генерации система записывает, каких экспертов выбрал каждый токен на каждом разреженном слое. При обучении она повторяет этот маршрут, но пересчитывает веса экспертов по текущим параметрам. Так выбор подсети остаётся связан с исходной траекторией, а маршрутизатор продолжает обучаться.

Вместе TITO и R3 сократили разницу логарифмических вероятностей между генератором и обучающей системой с 0,021 до 0,013. Дрейф токенов на участках, где рассчитывается ошибка, исчез. Это не делает два вычислительных контура полностью одинаковыми, но убирает расхождения, из-за которых обновление приписывалось другой последовательности или другой подсети.

Второй элемент рецепта — предварительно подготовленная модель ценности и подробная награда от исполняемого проверяющего кода. Первая кампания с наградой только за полный успех не превзошла версию после обучения по примерам: дорогостоящая траектория возвращала лишь ответ «решено» или «не решено».

В итоговой схеме проверяющий код сообщает результат каждого утверждения, а награда равна числу пройденных проверок по общей шкале. Агент получает сигнал даже после частичного успеха, а модель ценности распределяет его по предыдущим действиям. Задания дополнительно отбирали по согласованности инструкции, эталонного решения и проверок, чтобы агент не учился использовать слабые места проверяющего кода.

Что меняется в планах команд

Методику проверяли на Terminal-Bench 2.1, Long-Horizon Terminal Bench и Terminal-Bench Hard. Обучающие задания синтезировали отдельно от Terminal-Bench 2.1, а все результаты определял исполняемый проверяющий код. На длинном наборе T1 решила 27,9% задач, на усложнённом — 38%; в одинаковой агентской оболочке она также обошла GPT-5.4 и GLM-5.1.

Эти границы существенны: работа измеряет действия в изолированной командной оболочке, где результат можно проверить автоматически. Она поддерживает планы команд, которые обучают собственную модель для программирования, системного администрирования или работы с инфраструктурой, но не переносит выводы автоматически на браузерных агентов и процессы без исполняемых критериев успеха.

Для разреженной модели запись маршрутов стоит включать в архитектуру сбора траекторий до запуска дорогого обучения. Для плотной модели R3 не требуется, но TITO остаётся полезным: любой многошаговый агент может исказить историю при повторной обработке сообщений и результатов инструментов.

Главный практический вывод касается проверок. Один итоговый флаг расходует длинную траекторию почти впустую, тогда как отдельные проверяемые условия дают модели промежуточный сигнал без модели-оценщика. Если задачу нельзя разложить на исполняемые утверждения, основное преимущество рецепта T1 пропадает, даже если точно воспроизвести токены и вычислительный маршрут.

Источники

Иллюстрация: рисунок из статьи «T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks», Junyao Yang, Yucheng Shi, Zhongzhi Li и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу