Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Готовую языковую модель научились точнее переводить с последовательной генерации на параллельную работу внутри блоков. Ruitao Liu, Qinghao Hu и Song Han описали d-OPD в препринте, который не прошёл рецензирование и приводит числа из замеров самих авторов: метод обошёл прежний способ по качеству и времени обучения. Для команды конвертации это повод менять не архитектуру ученика, а подсказку от модели-учителя.
Обычный учитель не видит доступную ученику информацию
Авторегрессионная модель генерирует текст по одному токену: каждый следующий фрагмент зависит только от уже написанного. Блочная диффузионная модель движется слева направо блоками, но внутри текущего блока восстанавливает несколько скрытых позиций параллельно.
Такую модель можно не обучать с нуля, а получить из готовой авторегрессионной модели через дистилляцию. Исходная модель становится учителем и передаёт ученику распределение вероятностей возможных токенов.
OPDLM обучает ученика на состояниях, которые тот сам создаёт во время генерации. Это сближает обучение с реальной работой модели, однако оставляет другое расхождение: ученик видит уже открытые токены справа от скрытой позиции, а авторегрессионный учитель учитывает только текст слева.
d-OPD исправляет именно цель обучения. Для каждого возможного токена метод оценивает, насколько вероятным станет уже известное продолжение, если поставить этот токен в текущую позицию. Варианты, которые лучше согласуются с продолжением, получают больший вес в подсказке учителя.
Точный расчёт потребовал бы перебрать все способы заполнить скрытые позиции. Вместо этого d-OPD берёт завершённый блок из той же траектории ученика и использует его как приближение. Вероятность продолжения сравнивают с вероятностью при токене, который ученик действительно сгенерировал: так варианты без отдельной оценки не получают искусственного преимущества.
В контролируемом тесте такая поправка сократила расхождение с точно вычисленной целью на 71,9%. Расхождение измеряли через дивергенцию Кульбака — Лейблера, где меньшее значение означает более близкие распределения.
Оценивать весь словарь не пришлось. Метод берёт по 16 наиболее вероятных вариантов у учителя и ученика, затем объединяет списки. Они покрыли более 99% вероятностной массы при накладных расходах на обучение 2,63%. Поправку применяют только к траекториям, которые признал правильными проверяющий алгоритм; остальные по-прежнему получают обычную причинную подсказку.
Выигрыш сохраняется на разных размерах Qwen3
Метод проверили на моделях от Qwen3-0.6B до Qwen3-8B и на нескольких размерах блока. Качество считали как среднее по MMLU, MMLU-Pro, GPQA-Diamond, GSM8K, MATH500 и AIME25, выбирая контрольную точку с лучшим средним результатом.
Основным сравнением служил OPDLM — прежний метод дистилляции на траекториях ученика. d-OPD превосходил его на всех проверенных размерах модели, а максимальный прирост среднего результата составил 4,0 пункта. На старших моделях метод также показал лучший средний результат среди преобразованных моделей при сравнении с SFT, B-SFT и BARD.
Для оценки скорости авторы взяли лучшее качество OPDLM как общую цель и измерили, когда d-OPD впервые её достигает. Расчёт шёл по фактическому времени, поэтому включал дополнительные обращения к учителю для оценки продолжения. В лучшем случае d-OPD достиг цели в 1,58 раза быстрее: более точная подсказка компенсировала дополнительные вычисления на каждом шаге.
Менять стоит схему обучения, а не расчёт инфраструктуры
Работа напрямую касается команд, которые превращают существующий авторегрессионный контрольный файл в блочную диффузионную модель. Если текущая схема уже использует OPDLM или похожее обучение на траекториях ученика, d-OPD можно рассматривать как замену цели дистилляции без новой архитектуры модели.
В план обучения придётся добавить оценку продолжения для вероятных токенов и проверяющий алгоритм, который отделяет правильные траектории. Учитель должен выдавать вероятности токенов и оценивать завершённый суффикс при разных кандидатах. Значит, метод затрагивает не только функцию потерь, но и конвейер сбора обучающих состояний.
Для команд, которые продолжают использовать авторегрессионную генерацию или обучают диффузионную модель с нуля, работа планов не меняет. Найденное расхождение возникает именно при переносе знаний от причинного учителя к ученику, который видит обе стороны позиции внутри блока.
В статье измеряли качество преобразованной модели и время её обучения, но не задержку и пропускную способность при выдаче текста. Поэтому ускорение обучения нельзя переносить на производственный расчёт GPU: для такого решения по-прежнему нужен отдельный тест сервера и выбранного режима декодирования.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



