Журнал · Rit.work

Расписание диффузии подстроили под ошибки самой модели

Новый метод меняет скорость движения по траектории диффузии с учётом ошибок модели и улучшает FID, но требует повторного обучения.

Rit.work
Студия разработки
11 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Расписание обучения и генерации научились подстраивать под то, где модель чаще ошибается. В препринте команды LMU Munich, который не прошёл рецензирование и приводит замеры самих авторов, такое расписание снизило FID на 38,6% при 16 вызовах модели для согласования потоков на CIFAR-10. Метод не меняет архитектуру или траекторию смешивания данных с шумом, но требует обучить модель заново.

Как ошибка превращается в профиль риска

Диффузионная модель постепенно смешивает исходные данные с шумом, а затем учится двигаться в обратную сторону. Расписание задаёт коэффициенты сигнала и шума для каждого момента этого процесса. Стандартные варианты выбирают скорость движения по траектории без учёта того, насколько хорошо конкретная модель предсказывает нужную величину.

Авторы рассматривают состояние, в котором сигнал и шум уже сложены. Одно и то же состояние можно разложить на эти компоненты несколькими способами. Множество совместимых разложений они называют волокном: все его точки дают одну и ту же сумму, но по-разному распределяют её между сигналом и шумом.

Модель также выдаёт своё разложение текущего состояния. Метод измеряет расстояние между истинным и предсказанным разложениями внутри одного волокна с помощью оптимального транспорта. Такое сравнение не сдвигает само распределение состояний и отделяет ошибку предсказателя от геометрии траектории.

При прямом предсказании шума риск сводится к среднеквадратичной ошибке, умноженной на квадрат текущего коэффициента шума. Для других линейных целей, включая скорость, меняется формула пересчёта, но измеряется та же ошибка разложения. Поэтому подход применим и к DDPM, и к согласованию потоков.

Профиль риска не нужно оценивать на полностью обученной модели. Достаточно взять раннюю контрольную точку базового обучения, прогнать данные через модель и измерить ошибку вдоль исходного расписания. После этого профиль фиксируют и используют для одного пересчёта расписания.

Почему трудным участкам дают меньше времени

Метод сохраняет исходную кривую коэффициентов сигнала и шума, но меняет скорость движения по ней. Для сравнения разных моделей кривую сначала переводят в координату, где базовое расписание проходит её с постоянной кинетической скоростью. Это убирает различия, связанные только с тем, как системы нумеруют время.

Новое распределение времени выводится аналитически из двух слагаемых. Первое не позволяет проходить кривую слишком резко, второе штрафует время, проведённое в областях с высоким риском. В результате расписание быстрее проходит участки, где предсказатель ошибается сильнее, и отдаёт больше времени надёжным участкам.

Это может показаться обратным интуиции: сложному месту обычно хочется выделить больше вычислений. Но здесь речь не о дополнительных шагах численного решателя во время генерации. Расписание определяет, какие состояния модель чаще видит при обучении и как затем проходит ту же траекторию; долго оставаться в области с высокой ошибкой означает сильнее опираться на ненадёжное предсказание.

Нормированные профили риска оказались похожими у независимо обученных моделей, разных целей предсказания и архитектур. На CIFAR-10 аналитический шаблон, построенный из общей формы профиля, сохранил от 75,8 до 98,1% выигрыша специализированных расписаний. Он не требует отдельно оценивать риск и подгонять форму под каждую модель, хотя специализированный вариант дал дополнительный выигрыш для согласования потоков.

Когда стоит менять план разработки

Работа предлагает не замену архитектуры, функции потерь или численного решателя, а отдельную точку оптимизации. Команда может оставить коэффициентную кривую и остальной конвейер без изменений, оценить профиль по ранней контрольной точке, пересчитать распределение времени и повторить обучение. Такой эксперимент удобно проводить как изолированное сравнение с базовым расписанием.

Для уже обученной модели метод пока не выглядит способом улучшить генерацию одной заменой сетки шагов. В экспериментах новое расписание применяли и при повторном обучении, и при генерации. Диагностика крупных условных DiT и InstaFlow 2-RF показала сходную форму риска, но эти модели с новым расписанием целиком не переобучали.

Основные проверки качества провели на безусловной генерации изображений с DDPM и согласованием потоков, используя CIFAR-10 и ImageNet-64. Авторы меняли цели предсказания, архитектуры, настройки обучения, контрольные точки для оценки риска и численные решатели. Это подтверждает переносимость внутри изученного класса задач, но ещё не показывает эффект на больших условных моделях после полного обучения.

Если продукт обучает диффузионную или потоковую модель с нуля, расписание становится ещё одним контролируемым параметром с понятной процедурой оценки. Если команда только обслуживает готовую модель через API или меняет число шагов генерации, работа сама по себе план не меняет: её результат связан прежде всего с обучением, а не с настройкой уже развёрнутого решателя.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу