Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Дискретную диффузионную языковую модель научили надёжнее выбирать несколько токенов за один проход, не обучая для неё отдельную модель-учителя. Команда University of Basel, University of Amsterdam и Johns Hopkins University на Countdown сократила число проходов в 4,5 раза при сопоставимой точности, хотя препринт не рецензирован, а все числа получили сами авторы. Для команд, которым важна задержка ответа, это заменяет двухэтапную дистилляцию одним циклом дообучения.
Модель учится у собственного позднего решения
Маскированная диффузионная модель начинает генерацию с последовательности пустых позиций. На каждом шаге она предсказывает токены для этих позиций и открывает те, в которых уверена достаточно сильно. Чем больше токенов модель открывает одновременно, тем быстрее отвечает, но ранние предсказания опираются на неполный контекст и чаще оказываются ошибочными.
Временная самодистилляция (TSD) использует разницу между ранним и поздним состоянием одной генерации. Для каждой позиции метод запоминает распределение вероятностей в момент, когда модель окончательно выбрала токен. Затем он обучает более раннее предсказание для той же позиции приближаться к этому распределению.
Учитель и ученик здесь — одна модель в разные моменты генерации. Позднее предсказание видит больше открытых токенов и служит целью, но градиент через него не проходит. Отдельный контрольный набор траекторий и отдельная модель-учитель не нужны: цели обновляются вместе с текущим поведением модели.
Чтобы не считать градиенты на каждом шаге траектории, TSD случайно выбирает один ранний шаг. Проверяющая программа оценивает готовый ответ и снижает вес неудачных генераций, чтобы модель не закрепляла собственные ошибки. Для кода и математики метод также предпочитает короткие правильные ответы: они требуют меньше последовательных шагов и лучше соответствуют цели ускорения.
Выигрыш появляется при жёстком бюджете на генерацию
Стоимость измеряли через число прогонов модели (NFE): один такой прогон соответствует одному прямому проходу. Авторы меняли порог уверенности в декодере Fast-dLLM и строили границу между качеством и вычислительными затратами. Низкий порог открывает больше токенов параллельно, поэтому уменьшает задержку, но сильнее проверяет качество ранних предсказаний.
На MBPP модель достигла 40% успешно прошедших тесты программ, затратив в 2,3 раза меньше прогонов, чем исходная LLaDA, и в 1,5 раза меньше, чем dParallel с офлайн-дистилляцией. На HumanEval сопоставимый с базовой моделью результат потребовал около 45 прогонов — более чем вдвое меньше.
На Sudoku TSD одновременно улучшила скорость и точность относительно GDSD. На GSM8K преимущество сильнее проявилось при малом вычислительном бюджете. На MATH-500 исходная модель сохранила лучший пиковый результат при медленном декодировании: метод переносит уже доступное качество в ранние шаги, а не добавляет модели новые способности.
Менять архитектуру продукта рано, а план дообучения — уже можно
Метод проверяли на LLaDA-8B-Instruct и дообученной GDSD, на семи наборах задач по математике, планированию и программированию. Для всех вариантов использовали Fast-dLLM, а обучение проводили через LoRA. Проверка на полотнах разной длины показала перенос на более длинные ответы, но на коротком полотне качество заметно снижалось.
TSD имеет смысл закладывать в план, если продукт уже строится на маскированной диффузионной модели и задержку ограничивает число последовательных проходов. Это не замена модели и не настройка, которую можно добавить только на этапе запуска: понадобится дообучение на собственных траекториях и сравнение вариантов при том бюджете, с которым будет работать продукт.
Подход особенно подходит задачам с автоматической проверкой результата: выполнением тестов, точным числовым ответом или проверкой правил. Для открытого текста в работе его не испытывали, поскольку взвешивание траекторий опирается на программную оценку правильности. Метод также предполагает декодирование без пересмотра уже открытых токенов: иначе у позиции нет единственного момента, который можно использовать как позднюю цель.
Командам с офлайн-дистилляцией TSD предлагает более короткий конвейер: не нужно заранее собирать полный набор траекторий учителя и затем обучать отдельного ученика. Но выбирать метод только по максимальной точности не стоит. Его преимущество возникает в рабочей точке с малой задержкой, тогда как при большом бюджете базовая модель иногда остаётся точнее.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



