Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Повторно генерировать ответы студента во время дистилляции нужно не всегда: заранее собранные ответы часто повышают точность и сокращают обучение. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, Semi-OPD обошёл стандартный подход в 14 из 17 пар моделей, а максимальное ускорение составило 11,4 раза. Значит, онлайн-генерацию стоит включать после проверки совместимости учителя и студента, а не по умолчанию.
При дистилляции на текущих ответах студента (on-policy distillation, OPD) модель заново генерирует решения после каждого обновления, а учитель оценивает выбранные токены. Semi-OPD один раз собирает решения исходного студента, один раз получает оценки учителя и затем обучается на этом фиксированном наборе. Вероятности самого студента при этом пересчитываются на каждом шаге, поэтому обучающий сигнал продолжает меняться.
Выбирать режим предлагают по совпадению распределений учителя и студента. Для этого сравнивают наборы из 64 наиболее вероятных следующих токенов на каждом участке ответа. При низком совпадении новые решения студента по мере обучения всё дальше отходят от распределения учителя: ответы удлиняются, появляются циклы самокоррекции, а учитель реже поддерживает выбранные токены. Semi-OPD сохраняет более короткие исходные решения, но обучает на всей цепочке рассуждений.
Максимальный выигрыш Semi-OPD по точности достиг 13,6 процентного пункта. В парах с высоким совпадением стандартная OPD могла оказаться лучше, поэтому работа не предлагает полностью отказаться от онлайн-ответов. Практический порядок такой: сначала измерить совпадение на данных целевой области, затем выбрать фиксированный набор или постоянное обновление ответов.
Методы сравнили на моделях Qwen3, DeepSeek-R1-Distill и Nemotron-Cascade-2 в режимах с рассуждением и без него. Обучение шло на DAPO-Math, точность проверяли на AIME и HMMT, а перенос на программирование — на HumanEval и HumanEval+. Semi-OPD требовал достаточно сильных исходных решений: для базового студента они оказались слишком слабыми, тогда как после обучения следовать инструкциям метод вернул преимущество.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



