Журнал · Rit.work

Как постобучение и GenCorrect вывели Nemotron-3 на золотой уровень IOI

Авторы объединили обучение на олимпиадных задачах с итеративной проверкой решений и показали, какую часть результата дают модель, постобучение и вычисления во время запуска.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Aleksander Ficek и соавторы описали в нерецензированном препринте полный цикл специализации Nemotron-3 для олимпиадного программирования. В проведённом авторами запуске на IOI 2026 система получила 535,4 балла из 600 против 498,27 у лучшего участника. Работа важна командам, которые проектируют системы генерации кода и выбирают между дополнительным обучением модели и увеличением вычислений при её запуске.

Что сделали

Авторы собрали 22 тысячи задач по спортивному программированию и синтетические цепочки рассуждений. Nemotron-3-Nano-CC прошла контролируемое дообучение на готовых решениях и обучение с подкреплением, где награда зависела от успешной компиляции и прохождения тестов. Более крупную Nemotron-3-Ultra-CC обучали только первым способом.

Поверх моделей работает GenCorrect. На каждом этапе система генерирует до 200 решений, компилирует их, группирует по сходству поведения и отправляет на проверку 10 различных вариантов. Полученные оценки по подзадачам добавляются в контекст следующего этапа; всего проводится пять таких циклов.

По замерам авторов, на IOI 2025 результат Nano вырос со 130 баллов у базовой модели до 291 после постобучения и до 468 с GenCorrect. Это показывает, что в описанной системе основной итог складывается не только из параметров модели: контролируемое дообучение дало большую часть прироста одиночного ответа, а последовательная проверка и переработка решений вывела результат на золотой уровень.

Что это значит

Практический вывод состоит в разделении бюджета на два контура. Специализированное обучение повышает качество первой попытки, а GenCorrect расходует дополнительные вычисления на разнообразие, исполнение кода и исправление ошибок по внешней обратной связи. Для систем разработки это аргумент в пользу конвейера с компилятором, тестовой средой и состоянием предыдущих попыток, а не одного запроса к LLM.

Ограничения. Авторы проверяли подход на отдельных наборах IOI 2025, ICPC 2025 и LiveCodeBench Pro, а итоговый запуск IOI 2026 был одиночным, неофициальным и не контролировался организаторами. Сравнение с людьми уравнивало время, доступ к интернету и число отправок, но не вычислительные ресурсы. Для Ultra не проводили обучение с подкреплением и полное сравнение всех стадий в разных масштабах; работа также не показывает перенос результата на промышленную разработку и стоимость такого режима генерации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу