Журнал · Rit.work

Когда офлайн-ответы студента полезнее онлайн-дистилляции

Semi-OPD сохраняет исходные ответы студента и выигрывает у онлайн-дистилляции, если модели учителя и студента слабо согласованы.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Повторно генерировать ответы студента во время дистилляции нужно не всегда: заранее собранные ответы часто повышают точность и сокращают обучение. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, Semi-OPD обошёл стандартный подход в 14 из 17 пар моделей, а максимальное ускорение составило 11,4 раза. Значит, онлайн-генерацию стоит включать после проверки совместимости учителя и студента, а не по умолчанию.

При дистилляции на текущих ответах студента (on-policy distillation, OPD) модель заново генерирует решения после каждого обновления, а учитель оценивает выбранные токены. Semi-OPD один раз собирает решения исходного студента, один раз получает оценки учителя и затем обучается на этом фиксированном наборе. Вероятности самого студента при этом пересчитываются на каждом шаге, поэтому обучающий сигнал продолжает меняться.

Выбирать режим предлагают по совпадению распределений учителя и студента. Для этого сравнивают наборы из 64 наиболее вероятных следующих токенов на каждом участке ответа. При низком совпадении новые решения студента по мере обучения всё дальше отходят от распределения учителя: ответы удлиняются, появляются циклы самокоррекции, а учитель реже поддерживает выбранные токены. Semi-OPD сохраняет более короткие исходные решения, но обучает на всей цепочке рассуждений.

Максимальный выигрыш Semi-OPD по точности достиг 13,6 процентного пункта. В парах с высоким совпадением стандартная OPD могла оказаться лучше, поэтому работа не предлагает полностью отказаться от онлайн-ответов. Практический порядок такой: сначала измерить совпадение на данных целевой области, затем выбрать фиксированный набор или постоянное обновление ответов.

Методы сравнили на моделях Qwen3, DeepSeek-R1-Distill и Nemotron-Cascade-2 в режимах с рассуждением и без него. Обучение шло на DAPO-Math, точность проверяли на AIME и HMMT, а перенос на программирование — на HumanEval и HumanEval+. Semi-OPD требовал достаточно сильных исходных решений: для базового студента они оказались слишком слабыми, тогда как после обучения следовать инструкциям метод вернул преимущество.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу