Журнал · Rit.work

OPD перед RLVR обошла совместное обучение в замерах авторов

Авторы предлагают сначала обучать LLM на сигналах модели-учителя, а затем переходить к обучению с проверяемой наградой, не смешивая две цели.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из NYU, University of Chicago, University of Waterloo, University of Alberta, NYU Shanghai и Amii сравнили способы сочетания дистилляции и обучения с подкреплением при дообучении рассуждающих LLM. В препринте, не прошедшем рецензирования, авторы измерили преимущество последовательной схемы до 26,7 процентного пункта по pass@1 на логических задачах. Результат важен командам, которые проектируют собственный конвейер дообучения моделей для математики и формально проверяемых задач.

Что сделали

Авторы разделили обучение на два этапа. Сначала применили дистилляцию на данных самой обучаемой модели (on-policy distillation, OPD): ученик генерирует ответы, а модель-учитель даёт плотный сигнал для каждого токена. Затем переключились на RLVR — обучение с подкреплением и проверяемой наградой, где правильность всего ответа можно определить программно.

Такой порядок сопоставили с чистой OPD, чистым RLVR и методами, которые складывают либо взаимно масштабируют оба сигнала на каждом шаге. Основными моделями были Qwen3-8B в роли учителя и Qwen3-1.7B-Base в роли ученика. По интерпретации авторов, OPD сначала расширяет покрытие — набор задач, для которых модель способна найти правильное решение хотя бы среди нескольких генераций. RLVR затем перераспределяет вероятность в пользу удачных решений и повышает pass@1 — вероятность получить правильный ответ одной генерацией. При совместной оптимизации обновления параметров для этих двух целей частично конфликтовали.

Что это значит

OPD-then-RL стоит рассматривать как базовую схему для экспериментов, если уже доступны модель-учитель и автоматическая проверка ответа. Практический критерий переключения — качество OPD на проверочной выборке: в работе оно лучше предсказывало итог после RLVR, чем косвенные показатели вроде расхождения распределений ученика и учителя.

Ограничения. Основные замеры охватывают семь логических и математических тестов и конфигурацию с внешним, более крупным и неизменяемым учителем; дополнительные конфигурации вынесены в приложение. Работа не показывает, сохранится ли преимущество при самообучении, нескольких учителях или других целях дистилляции. Авторы также не провели контролируемое сравнение с вариантом, где RLVR сначала улучшает учителя, а затем знания переносятся ученику, при одинаковом вычислительном бюджете.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу