Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Дистилляцию LLM научились проводить на старых ответах ученика, не собирая свежие генерации перед каждым обновлением. Хотя работа не рецензирована и числа в ней получили сами авторы, вариант LSPD с буфером повторов достиг результата обычной OPD, использовав четверть пакетов генераций. Это меняет устройство контура обучения, если генерация ответов занимает в нём больше времени, чем обновление весов.
Почему OPD можно обучать как стратегию
При дистилляции на данных текущей модели (on-policy distillation, OPD) ученик сам генерирует ответы, а учитель оценивает вероятности следующих токенов для уже возникших префиксов. Обучение уменьшает обратное KL-расхождение — меру того, насколько распределение ученика расходится с распределением учителя именно на траекториях ученика.
Обычная реализация через PPO или GRPO тесно связывает обновление с текущей стратегией. После изменения модели старые ответы хуже соответствуют новому распределению, поэтому система регулярно запускает новые генерации и редко переиспользует накопленные траектории.
Работа показывает, что ту же цель можно точно записать как задачу обучения с подкреплением с KL-регуляризацией. Наградой для токена становится логарифм отношения вероятностей учителя и фиксированной опорной модели, а штраф удерживает ученика рядом с этой опорной моделью. Это не дополнительная эвристика поверх OPD, а другая запись исходной функции потерь.
Из этой записи авторы выводят Least Square Policy Distillation, или LSPD. Вместо градиента стратегии модель сближает логарифмы вероятностей ученика и учителя с помощью устойчивой квадратичной функции потерь. Такой критерий можно считать на сохранённых парах «префикс — следующий токен», даже если их создала более ранняя версия ученика.
Теоретическая конструкция выбирает наиболее выгодную награду среди вариантов, совместимых с собранными данными. Практическая версия не строит такие множества явно: она добавляет бонус за энтропию, чтобы ученик не сводил распределение к нескольким привычным продолжениям. LSPD повторно обновляется на последнем пакете, а LSPD-RB хранит прежние ответы в буфере и смешивает их при обучении.
Старые ответы сократили число новых генераций
Метод проверяли на шести математических наборах задач. Учителями и учениками служили три пары моделей семейства Qwen3, а для обучения использовали DAPO-Math-17K. Сравнение включало обычную дистилляцию, OPD и EOPD, которая отдельно учитывает неопределённость учителя.
LSPD обошёл OPD на 1,99 пункта по Avg@16 и на 2,27 пункта по Pass@16. Avg@16 показывает среднюю долю правильных ответов среди нескольких генераций, а Pass@16 — долю задач, где хотя бы одна попытка оказалась правильной. Вторая метрика помогает отличить модель, которая стабильно повторяет один способ решения, от модели с более широким набором рабочих траекторий.
Повторные обновления на одном свежем пакете ускоряли обучение, но эффект быстро насыщался. Вариант с буфером достигал своего предельного качества примерно за 10 пакетов генераций, тогда как LSPD с одним обновлением на пакет требовал более 40. При росте числа попыток преимущество LSPD сохранялось, что согласуется с заявленной целью: переносить знания учителя, не уничтожая разнообразие решений ученика.
Проверка охватывает математические рассуждения и модели одного семейства. Теоретическая оценка относится к идеализированному алгоритму и предполагает, что начальная стратегия достаточно хорошо покрывает распределение учителя; практическая нейросетевая версия заменяет часть этой конструкции устойчивой функцией потерь и энтропийным бонусом.
Когда LSPD меняет план обучения
Работа даёт основание менять контур дистилляции, если команда уже использует OPD и упирается в сбор ответов ученика. Вместо схемы «сгенерировать — один раз обновить — удалить» можно хранить запрос, ответ и токенные оценки учителя, затем выполнять несколько обновлений и выбирать старые траектории из буфера.
Такой переход не означает пропорционального снижения всей стоимости обучения. Эксперименты считают пакеты генераций, а не итоговое время или расходы на GPU: повторное использование ответов сокращает вызовы генерации, но добавляет шаги оптимизатора и требует хранить данные. Выигрыш зависит от того, какая часть контура дороже в конкретной инфраструктуре.
Для нового проекта LSPD скорее меняет требования к архитектуре эксперимента, чем выбор базовой модели. Стоит заранее сохранять версии ученика, префиксы, ответы и оценки учителя, а качество отслеживать не только по среднему ответу, но и по способности находить решение за несколько попыток. Без такого журнала добавить полноценный буфер повторов позднее будет сложнее.
Переносить метод в код, диалоги или работу с инструментами пока рано без собственного сравнения. Практический сигнал работы уже уже: старые генерации в OPD не обязательно считать одноразовыми, если функция потерь допускает обучение вне текущей стратегии.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



