Журнал · Rit.work

MiMo-V2.6 показала, как масштабировать обучение агентов с подкреплением

MiMo-V2.6 улучшала результаты по мере роста вычислений, но для этого потребовалось одновременно масштабировать генерацию решений, среды и модель-оценщик.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

MiMo-V2.6 научили устойчиво улучшаться на длинных агентских задачах, одновременно увеличив объём обучения, разнообразие сред и точность оценки решений. В препринте, который не прошёл рецензирование, сами авторы получили на DeepSWE прирост MiMo-V2.6-Pro на 14,2 пункта. Работа предлагает не новый отдельный алгоритм, а схему инфраструктуры для масштабного обучения агентов.

После короткого дообучения на готовых ответах модели обучали с подкреплением. Один шаг включал около 25 тысяч цепочек действий общим объёмом 2,7–3,7 млрд токенов, а контекст доходил до миллиона токенов. Асинхронная система не ждала самые медленные задания: незавершённые цепочки останавливала и продолжала на следующем шаге, заново собирая для них промежуточное состояние модели.

В одном пакете смешивали задачи по программированию, рабочим процессам, визуальному анализу и кибербезопасности. Для каждой области использовали разные агентские обвязки — наборы инструментов и правила взаимодействия со средой. Управление отделили от передачи данных, чтобы параллельно собирать длинные цепочки и не останавливать обучение.

Модель-оценщик сравнивала несколько решений одной задачи между собой, а не только проверяла, прошли ли они тесты. Так обучение различало формально правильные, но избыточные решения и более короткие варианты. Проверка заняла 12,7% вычислений MiMo-V2.6-Pro; дополнительно система отсеивала попытки получить высокую награду без решения задачи.

Подход проверили на двух версиях MiMo-V2.6 и задачах четырёх типов, используя как публичные, так и внутренние наборы тестов. Обучение MiMo-V2.6-Pro с подкреплением стоило 2,6 млн долларов, поэтому результат описывает масштаб крупной лаборатории. Для меньших команд практическая часть работы — открытые среды, журнал динамики обучения и программный каркас: они позволяют проверить ту же архитектуру процесса на доступном бюджете.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу