Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из NYU, University of Chicago, University of Waterloo, University of Alberta, NYU Shanghai и Amii сравнили способы сочетания дистилляции и обучения с подкреплением при дообучении рассуждающих LLM. В препринте, не прошедшем рецензирования, авторы измерили преимущество последовательной схемы до 26,7 процентного пункта по pass@1 на логических задачах. Результат важен командам, которые проектируют собственный конвейер дообучения моделей для математики и формально проверяемых задач.
Что сделали
Авторы разделили обучение на два этапа. Сначала применили дистилляцию на данных самой обучаемой модели (on-policy distillation, OPD): ученик генерирует ответы, а модель-учитель даёт плотный сигнал для каждого токена. Затем переключились на RLVR — обучение с подкреплением и проверяемой наградой, где правильность всего ответа можно определить программно.
Такой порядок сопоставили с чистой OPD, чистым RLVR и методами, которые складывают либо взаимно масштабируют оба сигнала на каждом шаге. Основными моделями были Qwen3-8B в роли учителя и Qwen3-1.7B-Base в роли ученика. По интерпретации авторов, OPD сначала расширяет покрытие — набор задач, для которых модель способна найти правильное решение хотя бы среди нескольких генераций. RLVR затем перераспределяет вероятность в пользу удачных решений и повышает pass@1 — вероятность получить правильный ответ одной генерацией. При совместной оптимизации обновления параметров для этих двух целей частично конфликтовали.
Что это значит
OPD-then-RL стоит рассматривать как базовую схему для экспериментов, если уже доступны модель-учитель и автоматическая проверка ответа. Практический критерий переключения — качество OPD на проверочной выборке: в работе оно лучше предсказывало итог после RLVR, чем косвенные показатели вроде расхождения распределений ученика и учителя.
Ограничения. Основные замеры охватывают семь логических и математических тестов и конфигурацию с внешним, более крупным и неизменяемым учителем; дополнительные конфигурации вынесены в приложение. Работа не показывает, сохранится ли преимущество при самообучении, нескольких учителях или других целях дистилляции. Авторы также не провели контролируемое сравнение с вариантом, где RLVR сначала улучшает учителя, а затем знания переносятся ученику, при одинаковом вычислительном бюджете.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



