Журнал · Rit.work

TSD ускоряет диффузионные языковые модели без отдельного учителя

TSD обучает диффузионную языковую модель раньше принимать собственные поздние решения и сокращает число проходов при параллельной генерации.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Дискретную диффузионную языковую модель научили надёжнее выбирать несколько токенов за один проход, не обучая для неё отдельную модель-учителя. Команда University of Basel, University of Amsterdam и Johns Hopkins University на Countdown сократила число проходов в 4,5 раза при сопоставимой точности, хотя препринт не рецензирован, а все числа получили сами авторы. Для команд, которым важна задержка ответа, это заменяет двухэтапную дистилляцию одним циклом дообучения.

Модель учится у собственного позднего решения

Маскированная диффузионная модель начинает генерацию с последовательности пустых позиций. На каждом шаге она предсказывает токены для этих позиций и открывает те, в которых уверена достаточно сильно. Чем больше токенов модель открывает одновременно, тем быстрее отвечает, но ранние предсказания опираются на неполный контекст и чаще оказываются ошибочными.

Временная самодистилляция (TSD) использует разницу между ранним и поздним состоянием одной генерации. Для каждой позиции метод запоминает распределение вероятностей в момент, когда модель окончательно выбрала токен. Затем он обучает более раннее предсказание для той же позиции приближаться к этому распределению.

Учитель и ученик здесь — одна модель в разные моменты генерации. Позднее предсказание видит больше открытых токенов и служит целью, но градиент через него не проходит. Отдельный контрольный набор траекторий и отдельная модель-учитель не нужны: цели обновляются вместе с текущим поведением модели.

Чтобы не считать градиенты на каждом шаге траектории, TSD случайно выбирает один ранний шаг. Проверяющая программа оценивает готовый ответ и снижает вес неудачных генераций, чтобы модель не закрепляла собственные ошибки. Для кода и математики метод также предпочитает короткие правильные ответы: они требуют меньше последовательных шагов и лучше соответствуют цели ускорения.

Выигрыш появляется при жёстком бюджете на генерацию

Стоимость измеряли через число прогонов модели (NFE): один такой прогон соответствует одному прямому проходу. Авторы меняли порог уверенности в декодере Fast-dLLM и строили границу между качеством и вычислительными затратами. Низкий порог открывает больше токенов параллельно, поэтому уменьшает задержку, но сильнее проверяет качество ранних предсказаний.

На MBPP модель достигла 40% успешно прошедших тесты программ, затратив в 2,3 раза меньше прогонов, чем исходная LLaDA, и в 1,5 раза меньше, чем dParallel с офлайн-дистилляцией. На HumanEval сопоставимый с базовой моделью результат потребовал около 45 прогонов — более чем вдвое меньше.

На Sudoku TSD одновременно улучшила скорость и точность относительно GDSD. На GSM8K преимущество сильнее проявилось при малом вычислительном бюджете. На MATH-500 исходная модель сохранила лучший пиковый результат при медленном декодировании: метод переносит уже доступное качество в ранние шаги, а не добавляет модели новые способности.

Менять архитектуру продукта рано, а план дообучения — уже можно

Метод проверяли на LLaDA-8B-Instruct и дообученной GDSD, на семи наборах задач по математике, планированию и программированию. Для всех вариантов использовали Fast-dLLM, а обучение проводили через LoRA. Проверка на полотнах разной длины показала перенос на более длинные ответы, но на коротком полотне качество заметно снижалось.

TSD имеет смысл закладывать в план, если продукт уже строится на маскированной диффузионной модели и задержку ограничивает число последовательных проходов. Это не замена модели и не настройка, которую можно добавить только на этапе запуска: понадобится дообучение на собственных траекториях и сравнение вариантов при том бюджете, с которым будет работать продукт.

Подход особенно подходит задачам с автоматической проверкой результата: выполнением тестов, точным числовым ответом или проверкой правил. Для открытого текста в работе его не испытывали, поскольку взвешивание траекторий опирается на программную оценку правильности. Метод также предполагает декодирование без пересмотра уже открытых токенов: иначе у позиции нет единственного момента, который можно использовать как позднюю цель.

Командам с офлайн-дистилляцией TSD предлагает более короткий конвейер: не нужно заранее собирать полный набор траекторий учителя и затем обучать отдельного ученика. Но выбирать метод только по максимальной точности не стоит. Его преимущество возникает в рабочей точке с малой задержкой, тогда как при большом бюджете базовая модель иногда остаётся точнее.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу