Журнал · Rit.work

Зашумлённый запрос улучшил обучение диффузионной языковой модели

Простая правка цели обучения повысила точность и разнообразие ответов диффузионной языковой модели без дополнительных затрат при обычной генерации.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Диффузионная языковая модель стала чаще находить решения для новых головоломок и выдавать разные допустимые ответы. В препринте Lateral Intelligence доля решённых сложных Sudoku выросла с 3,73% до 24,65%, хотя работа не рецензирована, а числа в ней получены самим автором. Для команд, которые обучают такие модели, метод сводится к небольшой правке цели обучения и не требует менять обычную генерацию.

Почему запрос тоже зашумляют

Диффузионная языковая модель начинает с зашумлённой последовательности и постепенно восстанавливает из неё ответ. При условной генерации модель также получает токены условия: например, заполненные клетки Sudoku, исходный текст для пересказа или реплику собеседника.

Обычно во время обучения ответ зашумляют, а условие оставляют чистым. Justin Jung предлагает на части обучающих примеров добавлять шум и к условию. Модель видит как простые случаи с полностью доступным запросом, так и сложные, где ей приходится восстанавливать недостающий сигнал.

Для каждого примера все токены условия либо остаются чистыми, либо получают тот же уровень шума, что и ответ. При этом модель предсказывает исходные токены всей последовательности, включая условие. Эта схема расширяет набор учебных задач без новых данных и не даёт модели слишком жёстко привязаться к формулировке запроса.

Полностью отказываться от чистых условий нельзя: тогда обучение расходится с генерацией, где запрос доступен целиком. Поэтому часть примеров по-прежнему содержит неизменённое условие, а их долю задаёт один параметр.

При обычной генерации процесс не меняется: чистые токены запроса возвращают в последовательность после каждого шага. Дополнительных вычислений нет. Работа также описывает управляемый режим, который совмещает предсказания для чистого и зашумлённого запроса, но он уже требует двух обращений к модели на шаге и меняет баланс между точностью и разнообразием.

Точность выросла сильнее на трудных задачах

На N-Queens автор измерял не только долю правильных досок, но и охват допустимых решений: какую часть разных верных вариантов модель находит при повторной генерации для одного условия. На досках 10×10 охват вырос с 50,60% до 73,79%. Модель реже сходилась к одному и тому же ответу.

В отдельном опыте с одним запуском зашумление запроса дало на простых Sudoku тот же результат, что десятикратное увеличение обучающего набора при стандартной схеме. Этот замер показывает возможную экономию данных, но одного запуска недостаточно, чтобы закладывать такой коэффициент в расчёт бюджета.

На естественном языке результат зависел от задачи. В Gigaword, где модель составляла краткие пересказы по сравнительно небольшому набору данных, зашумлённые запросы улучшили соотношение качества по MAUVE и разнообразия текста. В открытом диалоге разница осталась в пределах погрешности.

Метод проверяли на Sudoku, N-Queens, Gigaword и генерации диалогов. В основе экспериментов лежала небольшая Flow Language Model с DiT-подобным трансформером, которую обучали на одной NVIDIA L40S. Поэтому работа показывает поведение контролируемых моделей и наборов данных, а не крупных производственных LLM.

Когда стоит менять план обучения

Командам, которые уже обучают непрерывную диффузионную или потоковую языковую модель, имеет смысл добавить этот вариант как отдельный эксперимент. Он не требует новой архитектуры: достаточно иногда зашумлять всё условие вместе с ответом, оставить часть чистых запросов и считать ошибку по полной последовательности.

Основной кандидат — задача с формальными ограничениями и несколькими правильными ответами: заполнение структур, планирование или генерация конфигураций. Здесь полезны оба обнаруженных эффекта — модель точнее соблюдает условия и реже повторяет один вариант.

Для пересказов и диалогов менять план продукта рано. Результаты на двух языковых задачах разошлись, а крупных моделей в опытах не было. Практичный следующий шаг — сравнить стандартную и зашумлённую цели при одинаковом числе обучающих шагов, сохранив обычную генерацию; усложнять рабочий контур ради управляемого режима стоит только после отдельного замера цены.

Источники

Иллюстрация: рисунок из статьи «Noise Your Prompt: Noising Conditioning Tokens in Continuous Diffusion Language Models», Justin Jung, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу