Журнал · Rit.work

Открытый конвейер Nemotron достиг золотого порога IMO

Nemotron 3 Ultra показал, как сочетать специализированные варианты модели, строгую проверку и повторную правку доказательств вместо простого увеличения числа генераций.

Rit.work
Студия разработки
12 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Открытая система на базе Nemotron 3 Ultra достигла золотого порога IMO 2026, составляя доказательства на обычном языке без формального средства проверки. Она набрала 30 из 42 баллов, но препринт не прошёл рецензирование, а все приведённые замеры получили сами авторы. Результат показывает, что на сложных задачах качество зависит не только от самой модели, но и от того, как система генерирует, проверяет, исправляет и отбирает ответы.

Несколько вариантов модели ищут разные доказательства

В основе системы лежит Nemotron 3 Ultra. К общедоступной версии добавили два специализированных варианта: один дообучили с учителем на готовых доказательствах, проверках и исправлениях, второй обучили с подкреплением за успешное решение математических задач.

Эти варианты не закреплены за одной ролью навсегда. Они предлагают доказательства, проверяют чужие решения и переписывают кандидатов по замечаниям. Такое разделение позволяет использовать различия между моделями: вариант, который не нашёл исходное решение, иногда замечает ошибку или предлагает удачную правку.

В первом проходе система создаёт 384 доказательства. Запросы требуют разных стратегий: сначала сформулировать леммы, сравнить пути решения, поискать контрпример, проверить крайние случаи или построить доказательство через инвариант.

Каждый кандидат оценивают специализированные варианты Nemotron. Система принимает доказательство, только если все 16 независимых проверок признают его полностью верным. Если единогласия нет, лучшие кандидаты вместе с замечаниями возвращаются генераторам, а новые версии пополняют общий набор решений.

Финальный отбор устроен отдельно. Оставшиеся доказательства заново оценивают все варианты модели уже по шкале IMO, а не по критерию остановки поиска. Побеждает решение с лучшей средней оценкой; при равенстве система выбирает более короткий текст.

Строгая проверка полезнее раннего согласия

Для остановки поиска авторы намеренно выбрали осторожное правило. Ошочное принятие завершает работу над задачей с неверным доказательством, тогда как ошибочный отказ лишь задерживает ответ: кандидат остаётся в наборе и может попасть в следующую правку или финальный отбор.

На отдельной проверке единогласная комиссия ошибочно принимала около 1% неверных доказательств. Когда правило смягчили всего на два голоса, доля таких ошибок выросла до 17%. Эта деталь объясняет, зачем системе дорогая повторная оценка: большинство голосов здесь оказалось недостаточно надёжным.

Одновременно строгая комиссия часто отклоняла правильные доказательства. Для этого конвейера такой перекос допустим, потому что отказ не уничтожает решение. Архитектура хранит сильные кандидаты и продолжает работать с ними, вместо того чтобы превращать каждую проверку в окончательный приговор.

Разнообразие моделей также оказалось полезнее простого наращивания попыток одной модели. Дополнительные генерации варианта с обучением с подкреплением почти не расширяли набор решённых задач, тогда как вариант после дообучения с учителем находил другие решения. Общедоступная версия не добавила новых принятых доказательств в первом проходе, но её оставили для последующих правок, где иной стиль ответа повышал разнообразие.

Более сложные схемы маршрутизации и отбора не улучшили итоговый результат. Агрессивная фильтрация, напротив, могла удалить кандидата, который после исправлений превращался в верное доказательство. Практический вывод здесь не в усложнении управляющей логики, а в сохранении истории поиска и независимой перепроверке.

Планы меняет архитектура, а не новая базовая модель

Работа предлагает воспроизводимый образец для систем, где один длинный ответ трудно проверить автоматически. Вместо единственного вызова LLM команда может заложить параллельную генерацию, разнородные запросы, независимую критику, повторную правку и отдельный финальный отбор. Особенно уместна такая схема там, где ложное принятие обходится дороже дополнительной задержки.

Цена этого подхода — вычисления. Все отправленные на олимпиаду решения были найдены после генерации примерно 707 миллионов токенов и потребовали 1464 GPU-часа на NVIDIA GB200. Поэтому результат не служит ориентиром для обычного интерактивного продукта: это пример пакетного поиска с высоким бюджетом на один ответ.

Методику сравнивали на наборе из тридцати олимпиадных задач, а правила проверки отдельно изучали на трёхстах доказательствах. Все генераторы и основные оценщики относятся к семейству Nemotron 3 Ultra, а целевая задача — доказательства на естественном языке. Перенос результатов на код, документы или бизнес-решения потребует собственной проверки ошибок и стоимости.

Для экспериментов доступны специализированные варианты модели, обучающие данные, код обучения и запуска, отправленные решения и Nemotron-IMO-Bench. Это позволяет воспроизвести не только итоговый ответ, но и отдельные части конвейера: сравнить модели-оценщики, изменить правило остановки или измерить, окупается ли повторная правка на своей задаче.

Источники

Иллюстрация: рисунок из статьи «An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics», Ivan Moshkov, Stephen Ge, George Armstrong и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу