Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новый способ дистилляции учит языковую модель учитывать, как каждый токен влияет на продолжение ответа, а не копировать учителя только на следующем шаге. Во всех проверенных сценариях γOPD обошла другие методы дистилляции, хотя препринт не рецензирован и числа получили сами авторы. Для внедрения достаточно изменить расчёт обучающего сигнала: архитектура ученика и схема генерации остаются прежними.
Почему локальный сигнал теряет будущие ошибки
Дистилляция на траекториях текущей модели (on-policy distillation, OPD) работает так: ученик сам генерирует ответ, а учитель оценивает выбранные токены. Ученик затем сближает своё распределение с распределением учителя через обратную дивергенцию Кульбака — Лейблера.
На практике команды обычно считают сигнал отдельно для каждого токена. Такой вариант стабилен и не требует сравнивать распределения по всему словарю, но учитывает только текущий выбор. Если токен привёл рассуждение в неудачную ветку несколькими шагами позже, локальная оценка этого не отражает.
Последовательностный вариант учитывает все последующие шаги. Для каждого токена он суммирует различия между учеником и учителем до конца ответа, поэтому лучше соответствует исходной цели дистилляции. Но разброс такого сигнала в худшем случае растёт квадратично вместе с оставшейся длиной ответа, что делает обучение длинных рассуждений нестабильным.
γOPD занимает промежуточное положение. Метод переносит к текущему токену оценки будущих шагов, но ослабляет их по мере удаления. При коэффициенте, равном нулю, получается обычный локальный OPD; при единице — полный последовательностный вариант. Для любого фиксированного коэффициента меньше единицы авторы выводят верхнюю границу разброса, которая не зависит от длины ответа.
Как проверяемая награда ограничивает влияние учителя
Один лишь перенос сигнала во времени не снимает другое ограничение: ученик по-прежнему оптимизирует сходство с учителем. Если учитель предлагает правдоподобное, но неверное решение, плотная оценка токенов может конфликтовать с результатом компилятора или математической проверки.
Механизм RBM сначала приводит оценки учителя к масштабу конкретного ответа. Каждую оценку делят на сумму её абсолютной величины и среднего абсолютного значения по ответу, поэтому итоговый вклад учителя остаётся в ограниченном диапазоне. После этого к нему добавляют положительную или отрицательную награду от проверяющего инструмента.
Знак общего сигнала всегда задаёт проверяемый результат: верный ответ усиливается, неверный подавляется. Учитель влияет только на силу обновления отдельных токенов. Так компилятор или проверка математического ответа определяет направление обучения, а учитель помогает распределить заслугу и ошибку внутри цепочки рассуждений.
Метод проверяли на математике и программировании: использовали AIME24, AIME25, AMC23, MATH500, HumanEval+, MBPP+ и LiveCodeBench. Эксперименты охватили ученика одного размера с учителем, меньшего ученика и одного ученика с двумя специализированными учителями; все модели содержали меньше 10B параметров. Это границы вывода: работа показывает результат для проверяемых задач и сравнительно небольших моделей, а не для произвольных диалоговых или продуктовых сценариев.
Когда γOPD меняет план обучения модели
При дистилляции математической Qwen в ученика того же размера γOPD повысила среднюю точность на 2,30% относительно сильнейшего конкурирующего метода. Для меньшего ученика относительный прирост составил 4,92%, поэтому временной сигнал не требует равной ёмкости учителя и ученика.
В сценарии с отдельными учителями математики и кода итоговая средняя оценка достигла 66,00 против 64,36 у лучшей альтернативы по таблице. Метод выиграл не на каждом отдельном тесте, но дал лучший сводный результат по двум областям.
Разбор компонентов показывает, что одного сложения награды с дистилляцией недостаточно. Лучший вариант одновременно переносил сигнал от будущих шагов, ограничивал вклад учителя и оставлял проверяемой награде контроль над направлением обновления.
Дополнительные операции увеличили время вычислений примерно на 0,1%, а расход памяти изменился пренебрежимо мало. Команде с уже работающими OPD, генерацией траекторий и проверяющим инструментом не нужно менять модель или добавлять отдельный этап: потребуется пересчитать преимущество токена по будущим шагам и нормализовать его перед смешиванием с наградой.
Для обучения без надёжной автоматической проверки вывод уже: временное распределение сигнала можно применить отдельно, но RBM опирается на однозначный результат задачи. Поэтому работа напрямую меняет планы прежде всего для математических решателей, генераторов кода и других систем, где ответ можно проверить правилом или исполнением.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



