Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM можно дообучать по ответам модели-учителя без стандартной функции потерь на основе KL-дивергенции. В работе Wenze Lin и коллег, которая пока не рецензирована и приводит числа, полученные самими авторами, для сохранения качества хватило правильно обновлять менее 1,5% токенов. Это позволяет упростить функцию обучения и по-новому организовать дистилляцию от нескольких специализированных учителей.
Почему направления обновления может быть достаточно
При дистилляции на собственных ответах модели, или OPD, модель-ученик сначала генерирует ответ. Затем модель-учитель оценивает вероятность каждого выбранного токена, а ученик меняет свои вероятности так, чтобы приблизиться к учителю.
Обычно силу обновления задаёт обратная KL-дивергенция. Чем сильнее расходятся вероятности ученика и учителя, тем больше сигнал для соответствующего токена. Такая функция потерь передаёт и направление, и величину нужной поправки.
Предложенный метод BinaryOPD отбрасывает величину. Если учитель считает токен более вероятным, чем ученик, вероятность токена увеличивают; если менее вероятным — уменьшают. Модель получает только двоичный сигнал о том, в какую сторону двигаться.
Это работает благодаря замкнутой обратной связи. Ученик многократно посещает похожие состояния во время обучения и каждый раз получает новый сигнал от учителя. Если вероятность ещё слишком мала, обновление снова направляет её вверх; после пересечения нужного уровня направление меняется. Величина поправки возникает из последовательности шагов, а не задаётся в каждом шаге отдельно.
BinaryOPD при этом не устраняет обращения к учителю. Метод по-прежнему сравнивает вероятности моделей для каждого выбранного токена, поэтому работа упрощает правило обновления, но не показывает способ отказаться от прогонов модели-учителя.
Качество определяет малая группа спорных токенов
На математической паре Qwen3-4B BinaryOPD получил средний результат 65,1 против 64,1 у обычной OPD. На задачах по коду результаты почти совпали: 55,2 у BinaryOPD и 55,4 у OPD. Динамика точности, энтропии и длины ответов во время обучения также оставалась похожей.
Затем токены разделили по степени расхождения между учеником и учителем. К критической группе отнесли случаи, где одна модель заметно сильнее другой предпочитала уже выбранный токен. Остальные токены составляли основную массу, но их направление обновления влияло на итог слабее.
Когда критические токены двигали к учителю, обучение сохраняло результат даже после удаления большей части остальных сигналов. Когда ту же небольшую группу намеренно направляли от учителя, обучение ломалось. Некритические токены можно было исключать или даже обновлять в неверную сторону без такого резкого эффекта.
Значит, OPD не обязательно должна точно сближать полные распределения ученика и учителя. Практический сигнал сосредоточен там, где модели сильнее всего расходятся. Это объясняет, почему двоичное направление воспроизводит действие более подробной функции потерь.
Что меняется для команд, которые строят такое обучение
Главный кандидат для проверки в собственном контуре — не полный отказ от KL, а BinaryOPD как более простая контрольная схема. Если она повторяет качество базовой OPD, команде проще анализировать обновления и отделять важные токены от фоновых. Заменять рабочую функцию потерь только по этой статье рано: переносимость вывода зависит от того, повторяется ли эффект на конкретных моделях и данных.
Основной вывод проверяли на пяти парах ученика и учителя для математики и двух парах для кода. В опытах участвовали модели семейств Qwen, DeepSeek и Llama, обучение шло на DAPO-Math-17k, DeepMath и Eurus, а оценка — на математических и программных бенчмарках. Схему с несколькими учителями отдельно проверили на связке Qwen3-4B для математики и кода.
Для этой связки предложен C-MOPD. Обычная схема MOPD отправляет каждый пример одному профильному учителю, поэтому обновление по коду может ослабить математический навык и наоборот. C-MOPD запрашивает всех учителей: при согласии следует общему направлению, а при конфликте принимает сигнал профильного учителя лишь тогда, когда он не слишком сильно противоречит остальным.
Самая заметная разница проявилась на LiveCodeBench v6: C-MOPD получил 32,9 против 27,9 у MOPD и одновременно сохранил преимущество на большинстве математических проверок. Для команд с несколькими экспертными моделями это более прикладной результат работы: спорные токены можно использовать как фильтр конфликтов, а не назначать каждому примеру единственного учителя.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



