Журнал · Rit.work

Один токен убирает смещение из дистилляции по k лучшим вариантам

TT-OPD возвращает отброшенную вероятность в дистилляцию на ответах ученика и улучшает точность почти без дополнительных вычислений.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

При переносе навыков от большой LLM к меньшей градиент научились оценивать без систематической ошибки и без прохода по всему словарю. Метод TT-OPD обошёл два распространённых варианта дистилляции на математических задачах и генерации кода. Хотя препринт не рецензирован и числа в нём получили сами авторы, результат предлагает точечную замену функции потерь для команд, которые уже обучают модель на её собственных ответах.

Как один токен возвращает отброшенный хвост

При дистилляции на ответах ученика слабая модель сначала сама продолжает запрос. Затем на каждом шаге учитель оценивает состояние, в которое она попала, а обучение сближает распределения следующего токена. Так ученик исправляет ошибки в тех состояниях, которые действительно встречает при генерации, а не только в ответах учителя.

Целевая функция использует обратную дивергенцию Кульбака — Лейблера: она измеряет, насколько распределение ученика отличается от распределения учителя. Точный градиент требует учесть весь словарь. Например, словарь Qwen3 содержит 151 646 токенов, поэтому полный расчёт на каждой позиции дорог.

ST-OPD берёт только токен, который ученик уже выбрал для ответа. Такая оценка в среднем совпадает с полным градиентом, но один токен передаёт мало сведений о распределении учителя. TK-OPD вместо этого рассматривает k наиболее вероятных вариантов, однако отбрасывает остальную вероятность и перенормирует выбранную часть. Из-за этого градиент систематически отклоняется от целевого.

TT-OPD сохраняет точный вклад выбранных вариантов и добавляет токен из сгенерированного ответа, если тот не попал в набор. Поскольку ученик выбрал его из полного распределения, этот токен представляет отброшенный хвост. При многократной выборке средняя поправка восстанавливает его вклад, поэтому оценка становится несмещённой: её среднее равно градиенту по всему словарю.

Метод не запрашивает у учителя ещё одно распределение и повторно использует уже сгенерированный токен. Вычислительная сложность растёт с размером выбранного набора плюс одна операция, а не с размером словаря.

Поправка улучшила математику и код

На математических задачах TT-OPD повысил среднюю точность относительно TK-OPD на 4,34 процентного пункта для Qwen3-4B-Base и на 4,15 пункта для Qwen3-1.7B-Base. В опыте с DeepSeek-R1-Distill-Qwen-7B выигрыш составил 2,20 пункта, а на генерации кода — 0,72 пункта.

Главная проверка метода — опыт без поправки для хвоста. У меньшего ученика средняя точность упала на 10,76 пункта. Значит, результат дал не просто другой способ считать вклад наиболее вероятных токенов: существенную часть улучшения обеспечил именно токен за пределами выбранного набора.

Основные опыты использовали Qwen3-8B-Base-GRPO-Math как учителя и модели Qwen3 меньшего размера как учеников. Обучение шло на DAPO-Math-17K, а проверка охватывала AIME, AMC, MATH, Minerva и Olympiad. Отдельные эксперименты перенесли схему на связку Skywork и DeepSeek, а также на HumanEval+, MBPP+ и LiveCodeBench для кода.

TT-OPD сравнивали с оценкой по одному выбранному токену и с TK-OPD. Полнословарный вариант в практическое сравнение не вошёл из-за его вычислительной стоимости, поэтому работа показывает преимущество над дешёвыми приближениями, но не измеряет разницу с точным обучением по всему словарю.

Когда TT-OPD меняет план постобучения

Если команда уже применяет дистилляцию на ответах ученика и ограничивает расчёт наиболее вероятными токенами, TT-OPD выглядит как локальная замена. Он меняет функцию потерь на каждой позиции, но не требует другой архитектуры ученика, новых ответов учителя или изменений при выдаче. Сгенерированный токен уже присутствует в процессе обучения.

Метод особенно уместен при большом словаре, когда полный расчёт исключён по стоимости, а оценка по одному токену даёт слишком мало обучающего сигнала. Выбирать между дешёвым, но смещённым TK-OPD и дорогим полным распределением больше не обязательно: поправка сохраняет стоимость порядка k и убирает систематическую ошибку в ожидании.

Работа не меняет планы команд, которые обучают ученика только на готовых ответах учителя или обычным обучением с учителем. TT-OPD решает узкую задачу внутри дистилляции на собственных траекториях ученика. Также схема предполагает общий словарь у учителя и ученика, как в описанных опытах.

Для внедрения разумный следующий шаг — заменить текущую функцию потерь TK-OPD, сохранив выбор токенов, данные и режим генерации. Сравнивать стоит не только итоговую точность, но и время шага, расход памяти и устойчивость обучения на используемой паре моделей: статья показывает переносимость между несколькими конфигурациями, но не гарантирует одинаковый выигрыш для любого домена.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу