Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Aleksander Ficek и соавторы описали в нерецензированном препринте полный цикл специализации Nemotron-3 для олимпиадного программирования. В проведённом авторами запуске на IOI 2026 система получила 535,4 балла из 600 против 498,27 у лучшего участника. Работа важна командам, которые проектируют системы генерации кода и выбирают между дополнительным обучением модели и увеличением вычислений при её запуске.
Что сделали
Авторы собрали 22 тысячи задач по спортивному программированию и синтетические цепочки рассуждений. Nemotron-3-Nano-CC прошла контролируемое дообучение на готовых решениях и обучение с подкреплением, где награда зависела от успешной компиляции и прохождения тестов. Более крупную Nemotron-3-Ultra-CC обучали только первым способом.
Поверх моделей работает GenCorrect. На каждом этапе система генерирует до 200 решений, компилирует их, группирует по сходству поведения и отправляет на проверку 10 различных вариантов. Полученные оценки по подзадачам добавляются в контекст следующего этапа; всего проводится пять таких циклов.
По замерам авторов, на IOI 2025 результат Nano вырос со 130 баллов у базовой модели до 291 после постобучения и до 468 с GenCorrect. Это показывает, что в описанной системе основной итог складывается не только из параметров модели: контролируемое дообучение дало большую часть прироста одиночного ответа, а последовательная проверка и переработка решений вывела результат на золотой уровень.
Что это значит
Практический вывод состоит в разделении бюджета на два контура. Специализированное обучение повышает качество первой попытки, а GenCorrect расходует дополнительные вычисления на разнообразие, исполнение кода и исправление ошибок по внешней обратной связи. Для систем разработки это аргумент в пользу конвейера с компилятором, тестовой средой и состоянием предыдущих попыток, а не одного запроса к LLM.
Ограничения. Авторы проверяли подход на отдельных наборах IOI 2025, ICPC 2025 и LiveCodeBench Pro, а итоговый запуск IOI 2026 был одиночным, неофициальным и не контролировался организаторами. Сравнение с людьми уравнивало время, доступ к интернету и число отправок, но не вычислительные ресурсы. Для Ultra не проводили обучение с подкреплением и полное сравнение всех стадий в разных масштабах; работа также не показывает перенос результата на промышленную разработку и стоимость такого режима генерации.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



