Журнал · Rit.work

LSPD переиспользует генерации при дистилляции LLM

LSPD переводит дистилляцию LLM в рамку обучения с подкреплением и позволяет повторно обучаться на старых генерациях ученика.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Дистилляцию LLM научились проводить на старых ответах ученика, не собирая свежие генерации перед каждым обновлением. Хотя работа не рецензирована и числа в ней получили сами авторы, вариант LSPD с буфером повторов достиг результата обычной OPD, использовав четверть пакетов генераций. Это меняет устройство контура обучения, если генерация ответов занимает в нём больше времени, чем обновление весов.

Почему OPD можно обучать как стратегию

При дистилляции на данных текущей модели (on-policy distillation, OPD) ученик сам генерирует ответы, а учитель оценивает вероятности следующих токенов для уже возникших префиксов. Обучение уменьшает обратное KL-расхождение — меру того, насколько распределение ученика расходится с распределением учителя именно на траекториях ученика.

Обычная реализация через PPO или GRPO тесно связывает обновление с текущей стратегией. После изменения модели старые ответы хуже соответствуют новому распределению, поэтому система регулярно запускает новые генерации и редко переиспользует накопленные траектории.

Работа показывает, что ту же цель можно точно записать как задачу обучения с подкреплением с KL-регуляризацией. Наградой для токена становится логарифм отношения вероятностей учителя и фиксированной опорной модели, а штраф удерживает ученика рядом с этой опорной моделью. Это не дополнительная эвристика поверх OPD, а другая запись исходной функции потерь.

Из этой записи авторы выводят Least Square Policy Distillation, или LSPD. Вместо градиента стратегии модель сближает логарифмы вероятностей ученика и учителя с помощью устойчивой квадратичной функции потерь. Такой критерий можно считать на сохранённых парах «префикс — следующий токен», даже если их создала более ранняя версия ученика.

Теоретическая конструкция выбирает наиболее выгодную награду среди вариантов, совместимых с собранными данными. Практическая версия не строит такие множества явно: она добавляет бонус за энтропию, чтобы ученик не сводил распределение к нескольким привычным продолжениям. LSPD повторно обновляется на последнем пакете, а LSPD-RB хранит прежние ответы в буфере и смешивает их при обучении.

Старые ответы сократили число новых генераций

Метод проверяли на шести математических наборах задач. Учителями и учениками служили три пары моделей семейства Qwen3, а для обучения использовали DAPO-Math-17K. Сравнение включало обычную дистилляцию, OPD и EOPD, которая отдельно учитывает неопределённость учителя.

LSPD обошёл OPD на 1,99 пункта по Avg@16 и на 2,27 пункта по Pass@16. Avg@16 показывает среднюю долю правильных ответов среди нескольких генераций, а Pass@16 — долю задач, где хотя бы одна попытка оказалась правильной. Вторая метрика помогает отличить модель, которая стабильно повторяет один способ решения, от модели с более широким набором рабочих траекторий.

Повторные обновления на одном свежем пакете ускоряли обучение, но эффект быстро насыщался. Вариант с буфером достигал своего предельного качества примерно за 10 пакетов генераций, тогда как LSPD с одним обновлением на пакет требовал более 40. При росте числа попыток преимущество LSPD сохранялось, что согласуется с заявленной целью: переносить знания учителя, не уничтожая разнообразие решений ученика.

Проверка охватывает математические рассуждения и модели одного семейства. Теоретическая оценка относится к идеализированному алгоритму и предполагает, что начальная стратегия достаточно хорошо покрывает распределение учителя; практическая нейросетевая версия заменяет часть этой конструкции устойчивой функцией потерь и энтропийным бонусом.

Когда LSPD меняет план обучения

Работа даёт основание менять контур дистилляции, если команда уже использует OPD и упирается в сбор ответов ученика. Вместо схемы «сгенерировать — один раз обновить — удалить» можно хранить запрос, ответ и токенные оценки учителя, затем выполнять несколько обновлений и выбирать старые траектории из буфера.

Такой переход не означает пропорционального снижения всей стоимости обучения. Эксперименты считают пакеты генераций, а не итоговое время или расходы на GPU: повторное использование ответов сокращает вызовы генерации, но добавляет шаги оптимизатора и требует хранить данные. Выигрыш зависит от того, какая часть контура дороже в конкретной инфраструктуре.

Для нового проекта LSPD скорее меняет требования к архитектуре эксперимента, чем выбор базовой модели. Стоит заранее сохранять версии ученика, префиксы, ответы и оценки учителя, а качество отслеживать не только по среднему ответу, но и по способности находить решение за несколько попыток. Без такого журнала добавить полноценный буфер повторов позднее будет сложнее.

Переносить метод в код, диалоги или работу с инструментами пока рано без собственного сравнения. Практический сигнал работы уже уже: старые генерации в OPD не обязательно считать одноразовыми, если функция потерь допускает обучение вне текущей стратегии.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу