Журнал · Rit.work

d-OPD учитывает будущие токены при конвертации Qwen3

Новый метод согласует подсказки авторегрессионного учителя с контекстом блочной диффузионной модели и сокращает время её обучения.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Готовую языковую модель научились точнее переводить с последовательной генерации на параллельную работу внутри блоков. Ruitao Liu, Qinghao Hu и Song Han описали d-OPD в препринте, который не прошёл рецензирование и приводит числа из замеров самих авторов: метод обошёл прежний способ по качеству и времени обучения. Для команды конвертации это повод менять не архитектуру ученика, а подсказку от модели-учителя.

Обычный учитель не видит доступную ученику информацию

Авторегрессионная модель генерирует текст по одному токену: каждый следующий фрагмент зависит только от уже написанного. Блочная диффузионная модель движется слева направо блоками, но внутри текущего блока восстанавливает несколько скрытых позиций параллельно.

Такую модель можно не обучать с нуля, а получить из готовой авторегрессионной модели через дистилляцию. Исходная модель становится учителем и передаёт ученику распределение вероятностей возможных токенов.

OPDLM обучает ученика на состояниях, которые тот сам создаёт во время генерации. Это сближает обучение с реальной работой модели, однако оставляет другое расхождение: ученик видит уже открытые токены справа от скрытой позиции, а авторегрессионный учитель учитывает только текст слева.

d-OPD исправляет именно цель обучения. Для каждого возможного токена метод оценивает, насколько вероятным станет уже известное продолжение, если поставить этот токен в текущую позицию. Варианты, которые лучше согласуются с продолжением, получают больший вес в подсказке учителя.

Точный расчёт потребовал бы перебрать все способы заполнить скрытые позиции. Вместо этого d-OPD берёт завершённый блок из той же траектории ученика и использует его как приближение. Вероятность продолжения сравнивают с вероятностью при токене, который ученик действительно сгенерировал: так варианты без отдельной оценки не получают искусственного преимущества.

В контролируемом тесте такая поправка сократила расхождение с точно вычисленной целью на 71,9%. Расхождение измеряли через дивергенцию Кульбака — Лейблера, где меньшее значение означает более близкие распределения.

Оценивать весь словарь не пришлось. Метод берёт по 16 наиболее вероятных вариантов у учителя и ученика, затем объединяет списки. Они покрыли более 99% вероятностной массы при накладных расходах на обучение 2,63%. Поправку применяют только к траекториям, которые признал правильными проверяющий алгоритм; остальные по-прежнему получают обычную причинную подсказку.

Выигрыш сохраняется на разных размерах Qwen3

Метод проверили на моделях от Qwen3-0.6B до Qwen3-8B и на нескольких размерах блока. Качество считали как среднее по MMLU, MMLU-Pro, GPQA-Diamond, GSM8K, MATH500 и AIME25, выбирая контрольную точку с лучшим средним результатом.

Основным сравнением служил OPDLM — прежний метод дистилляции на траекториях ученика. d-OPD превосходил его на всех проверенных размерах модели, а максимальный прирост среднего результата составил 4,0 пункта. На старших моделях метод также показал лучший средний результат среди преобразованных моделей при сравнении с SFT, B-SFT и BARD.

Для оценки скорости авторы взяли лучшее качество OPDLM как общую цель и измерили, когда d-OPD впервые её достигает. Расчёт шёл по фактическому времени, поэтому включал дополнительные обращения к учителю для оценки продолжения. В лучшем случае d-OPD достиг цели в 1,58 раза быстрее: более точная подсказка компенсировала дополнительные вычисления на каждом шаге.

Менять стоит схему обучения, а не расчёт инфраструктуры

Работа напрямую касается команд, которые превращают существующий авторегрессионный контрольный файл в блочную диффузионную модель. Если текущая схема уже использует OPDLM или похожее обучение на траекториях ученика, d-OPD можно рассматривать как замену цели дистилляции без новой архитектуры модели.

В план обучения придётся добавить оценку продолжения для вероятных токенов и проверяющий алгоритм, который отделяет правильные траектории. Учитель должен выдавать вероятности токенов и оценивать завершённый суффикс при разных кандидатах. Значит, метод затрагивает не только функцию потерь, но и конвейер сбора обучающих состояний.

Для команд, которые продолжают использовать авторегрессионную генерацию или обучают диффузионную модель с нуля, работа планов не меняет. Найденное расхождение возникает именно при переносе знаний от причинного учителя к ученику, который видит обе стороны позиции внутри блока.

В статье измеряли качество преобразованной модели и время её обучения, но не задержку и пропускную способность при выдаче текста. Поэтому ускорение обучения нельзя переносить на производственный расчёт GPU: для такого решения по-прежнему нужен отдельный тест сервера и выбранного режима декодирования.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу