Журнал · Rit.work

Почему большая диффузионная модель плохо учит маленькую

GFD-OPD переносит поведение большой диффузионной модели в меньшую, не давая наведению без классификатора усиливать ошибки ученика.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Большую диффузионную модель научились переносить в меньшую без потери текстур и затемнения изображений, которые возникали при обычной дистилляции. Команда Hefei University of Technology, Tsinghua University и Zhipu AI показала, что GFD-OPD обходит прежние методы уже в первые 10 GPU-часов обучения, хотя препринт не рецензирован, а числа получили сами авторы. Для команд, которые сжимают генераторы изображений, работа меняет не выбор базовой модели, а способ строить обучение ученика.

Почему обычная дистилляция портит изображение

Дистилляция на траекториях ученика, или OPD, обучает меньшую модель на состояниях, которые она сама получает при генерации. На каждом шаге большая модель подсказывает, куда двигаться дальше. Такой подход даёт плотный обучающий сигнал вместо одной итоговой оценки изображения.

В диффузионных моделях стандартный рецепт сопоставляет итоговые направления движения учителя и ученика после наведения без классификатора (CFG). Этот механизм складывает условную ветвь, которая учитывает запрос, и безусловную ветвь, а разницу между ними умножает на коэффициент наведения.

Когда учитель и ученик сопоставимы по размеру, ошибки двух ветвей могут взаимно погаситься. Маленький ученик хуже приближает обе ветви большой модели, поэтому компенсация перестаёт работать. CFG умножает оставшееся расхождение на каждом шаге, а оно накапливается по траектории. В экспериментах это проявлялось как повреждённые области, потеря мелких текстур, дымка и более тёмный общий тон.

Отдельное обучение условной и безусловной ветвей проблему не решило. Каждая ветвь стала ближе к соответствующей ветви учителя, но их последующее сложение убрало полезную компенсацию ошибок. Итоговое распределение изображений осталось дальше от учителя.

Как Fixed-State KL отделяет ошибку модели от плохой траектории

Обычная метрика OPD измеряет расхождение учителя и ученика на траектории самого ученика. Сравнивать методы так трудно: каждый ученик посещает свой набор состояний, а неудачная модель может уйти в область, где подсказки учителя уже мало что говорят о нормальной генерации.

Fixed-State KL фиксирует проверочные состояния для всех моделей. Авторы берут их из нормальных траекторий учителя и из реальных изображений с добавленным шумом. Затем считают расхождение KL — меру различия двух распределений — на одинаковых входах. Поэтому метрика показывает именно разрыв между моделями, а не различие их маршрутов.

При переносе SD3.5-Large в SD3.5-Medium стандартный DiffusionOPD получил расхождение 0,068 на траекториях учителя. При переносе между моделями одного масштаба оно составило 0,041. GFD снизил значение до 0,050.

Сам GFD убирает источник усиления ошибки. Вместо попытки воспроизвести две ветви учителя метод записывает уже направленное поведение учителя прямо в условную ветвь ученика. Маленькой модели остаётся приблизить одно поле движения, а при генерации не приходится заново собирать его из двух неточных частей.

После такого сворачивания остаётся небольшой систематический разрыв: ученик сохраняет направление учителя, но ослабляет его величину в сторону своей исходной модели. В полном варианте GFD-OPD цель немного сдвигают дальше от исходного ученика. Это заменяет сильное дополнительное наведение при использовании модели.

Что менять в плане обучения компактной модели

Работа предлагает практическую последовательность для команды, которая уже выбрала большой генератор как учителя. Сначала стоит оценивать кандидатов на общем наборе состояний, а не только на их собственных траекториях. Затем нужно обучать условную ветвь сразу на направленном выходе учителя, не рассчитывая, что маленькая модель точно повторит обе ветви CFG.

На одном задании GFD-OPD требовал около 10 GPU-часов против 15 у DiffusionOPD и 160 у прямого обучения с подкреплением Flow-GRPO. Это не оценка стоимости эксплуатации: в работе сравнивали вычисления на этапе дообучения при одинаковой экспериментальной схеме.

На GenEval ученик достиг 0,963 против 0,949 у большого учителя. Он также опередил базовые методы на распознавании текста, соответствии предпочтениям и метриках качества изображения. Превосходство над учителем не означает, что маленькая модель стала сильнее во всех задачах: цель обучения была сдвинута в сторону конкретных оценок.

Границы проверки достаточно узкие для решения об архитектуре продукта. Метод испытывали на семействах SD3.5 и FLUX.2, на композиции объектов, отрисовке текста и соответствии предпочтениям, с одинаковыми запросами, начальными случайными значениями и алгоритмом выборки. Все модели дообучали целиком, поэтому результаты напрямую не отвечают на вопрос, сохранится ли эффект при адаптерах или частичном обновлении параметров.

Если план уже включает дистилляцию большого генератора в меньший, стандартный DiffusionOPD теперь разумнее считать контрольным вариантом, а не основным рецептом. Если команда только выбирает семейство моделей или не использует CFG, работа сама по себе этот выбор не меняет.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу