Журнал · Rit.work

CDMD сжимает диффузионную модель без исходного датасета

CDMD обучает быструю версию диффузионной модели без исходного датасета, прогонов учителя и отдельной вспомогательной сети.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Диффузионную модель научились сжимать до одного или нескольких шагов генерации без исходного датасета и заранее рассчитанных траекторий учителя. В нерецензированном препринте, где все числа получили сами авторы, CDMD достиг FID 2,04 при генерации за один проход сети. Метод сокращает обучающий конвейер до замороженного учителя, одного ученика и одной функции потерь.

Одна сеть генерирует изображения и оценивает собственное движение

Обычная дистилляция учит компактную модель повторять поведение большой. Для диффузионных моделей это часто требует либо реальных изображений, либо траекторий учителя, рассчитанных через много последовательных шагов, либо отдельной сети, которая оценивает текущее распределение ученика.

Последний вариант усложняет обучение. Вспомогательную сеть приходится постоянно подстраивать под меняющегося ученика, хотя после обучения она больше не нужна. Возникают две связанные задачи оптимизации: генератор должен приближаться к учителю, а оценщик — успевать за генератором.

CDMD объединяет эти роли. Ученик предсказывает среднюю скорость перехода между произвольными моментами процесса зашумления. Та же сеть может провести образец от шума к готовому изображению и оценить мгновенную скорость в промежуточной точке.

Чтобы получить обучающий пример, метод берёт случайный шум, частично очищает его учеником, а затем аналитически снова добавляет шум до выбранного уровня. Учитель сообщает правильную скорость движения для полученного состояния. Поэтому обучение не требует изображений из исходного датасета и не запускает полную обратную траекторию учителя.

Поправку к скорости вычисляют через произведение якобиана на вектор — способ узнать, как выход сети меняется в выбранном направлении, не строя всю матрицу производных. Градиент через эту поправку останавливают, чтобы не считать производные более высокого порядка. В синтетических опытах направление скорости учителя давало наиболее стабильную поправку.

Теоретическая часть связывает локальную ошибку скорости с расстоянием Вассерштейна, которое измеряет затраты на перенос одного распределения в другое. При заданных условиях на гладкость и покрытие состояний уменьшение функции потерь сближает распределения ученика и учителя, а оптимальное решение восстанавливает среднюю скорость учителя. Доказательство не требует брать обучающие состояния непосредственно из его траектории.

Качество растёт, если оставить несколько шагов генерации

Основной количественный эксперимент провели на ImageNet с разрешением 256×256. FID сравнивает распределения признаков у сгенерированных и настоящих изображений: чем ниже значение, тем ближе наборы. За один проход сети CDMD получил FID 2,04, а за четыре прохода — 1,37.

Среди рассмотренных методов дистилляции без данных CDMD показал лучший результат. Важна не только итоговая метрика: одна обученная сеть поддерживает как однопроходную генерацию, так и более точный режим с несколькими шагами. Команда может менять задержку на качество без обучения отдельной модели под каждый бюджет вычислений.

Границы проверки проходят прежде всего по генерации изображений. Авторы оценивали метод на ImageNet, разбирали поведение поправки на двумерных наборах и применяли подход к генерации изображений по тексту с SANA-1.6B. Примеры большего разрешения приведены отдельно, но главный сопоставимый результат относится к классовой генерации на ImageNet. Инициализацию ученика при отсутствии подходящих весов работа оставляет для дальнейшего исследования.

Когда CDMD меняет план обучения модели

Работа меняет архитектуру конвейера, если команда уже выбрала диффузионного учителя, но не имеет доступа к его обучающему датасету. Это характерно для закрытых моделей, сторонних контрольных точек и учителей, дообученных на недоступных данных. CDMD строит обучающие состояния из текущего ученика, поэтому отдельный набор изображений для дистилляции не становится обязательной зависимостью.

Второй сценарий — дорогие прогоны учителя. Вместо численного расчёта полной траектории учитель оценивает скорость только в состоянии, которое подготовил ученик. Это убирает предварительное накопление траекторий и снижает число компонентов, которые нужно хранить, обновлять и синхронизировать.

Метод не превращает обучение в обычное копирование выходов. Качество сигнала зависит от того, насколько состояния ученика остаются в области, где учитель даёт полезную скорость. Теоретическая гарантия тоже опирается на покрытие таких состояний. Если ученик стартует далеко от учителя, упрощённый конвейер сам по себе не гарантирует устойчивость.

Для продуктовой команды CDMD скорее меняет устройство пилота, чем выбор базового генератора. Вместо конвейера из учителя, генератора, вспомогательного оценщика и датасета можно проверить схему из двух моделей с одной целью обучения. Сначала стоит сопоставить качество и задержку на собственных запросах, а затем решить, оправдывает ли отсутствие данных и прогонов учителя дополнительную работу с новой функцией потерь.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу