Журнал · Rit.work

Почему постоянная сила управления мешает короткой диффузии

LEEGS обучает отдельную силу управления для каждого шага генерации; разбираем обучение, замеры на изображениях и физических задачах и условия, при которых подход окупает настройку.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Диффузионную модель научили точнее выполнять заданное условие при короткой генерации, не меняя её веса. В препринте Aneesh Barthakur, Mathias Niepert и Luiz F. O. Chamon, который не рецензировался и содержит замеры самих авторов, LEEGS на проверенных задачах сохраняет результат постоянной силы управления, используя 10% шагов. Подход может сократить вычисления там, где продукт многократно решает одну и ту же задачу с дифференцируемым критерием результата.

Как график получает сигнал от всей траектории

Управляемая диффузия добавляет к каждому обратному шагу градиент функции потерь. Например, при восстановлении изображения функция измеряет расхождение с известными пикселями, а в генерации лица — расстояние до признаков эталонной фотографии. Коэффициент перед градиентом задаёт силу управления.

Постоянный коэффициент создаёт компромисс. Слабое управление сохраняет правдоподобие изображения, но не обеспечивает нужное условие. Сильное уводит траекторию от распределения, которому обучена модель, поэтому появляются насыщенные цвета и другие артефакты. Увеличение числа шагов смягчает конфликт, но повышает стоимость генерации.

LEEGS заменяет один коэффициент неотрицательным вектором: у каждого шага появляется своя сила управления. График обучают отдельно для заданной модели, задачи и алгоритма выборки, а веса самой диффузионной модели оставляют неизменными. Оптимизатор минимизирует среднюю ошибку на небольшом наборе условий и начальных шумов.

Целевая функция включает ошибку не только готового результата, но и промежуточных оценок очищенного образца. Если учитывать лишь последний результат, ранние шаги длинной траектории получают слишком слабый градиент. Сумма ошибок вдоль всей траектории даёт обучающий сигнал каждому коэффициенту.

Полная обратная передача требует вторых производных через функцию управления и дорого обходится. LEEGS игнорирует эту часть производной, но сохраняет влияние коэффициента через последующие шаги алгоритма выборки. Такое приближение обучается примерно вчетверо быстрее точного варианта. Повторное вычисление активаций во время обратного прохода удерживает пиковую память на одном уровне при росте длины траектории.

Где короткая траектория сохранила качество

Метод проверяли на восстановлении пропущенных частей изображений, шумных обратных задачах, генерации лица по эталонному фото и решении дифференциальных уравнений в частных производных. В опытах использовали CelebA-HQ, FFHQ и ImageNet, а также задачи Helmholtz, Poisson и Darcy. Основные сравнения проводили при бюджетах 50 и 100 вычислений нейросети.

Среди соперников были постоянное управление, линейно растущий и убывающий графики, а для изображений — CDIM, DSG, DAPS и RePaint. Качество оценивали через LPIPS, то есть визуальное расхождение с исходным изображением, и FID — отличие распределения результатов от эталонных данных. Для обеих метрик меньшее значение означает лучший результат.

На восстановлении после размытия движением для FFHQ LEEGS получил LPIPS 0,211 против 0,466 у постоянного управления при меньшем из двух основных бюджетов. При этом метод не выигрывал каждую метрику: в некоторых опытах соперники давали лучший FID. Практический результат работы — более выгодный баланс между соблюдением условия и правдоподобием, а не безусловная победа по всем критериям.

Границы проверки широки по типам задач, но график не оказался универсальным. Наилучший результат почти всегда давал график, обученный под конкретный оператор искажения. После выравнивания средней силы управления некоторые графики переносились лучше, однако форма по-прежнему влияла на качество.

Когда LEEGS стоит закладывать в продукт

Работа меняет планы точечно. LEEGS имеет смысл добавить в прототип, если условие можно выразить дифференцируемой функцией потерь, задача повторяется в стабильной конфигурации, а стоимость обучения графика затем распределяется на большой поток запросов. После обучения график не добавляет вычислений поверх обычной управляемой выборки с тем же числом шагов.

Для редких запросов или часто меняющихся условий постоянный коэффициент остаётся проще. График привязан не только к задаче, но и к модели, алгоритму выборки и длине траектории. При смене одного из этих компонентов потребуется как минимум повторная проверка, а часто и новое обучение. Поэтому LEEGS лучше рассматривать как часть оптимизации конкретного конвейера, а не как готовую настройку для любой диффузионной модели.

При обучении нужен отдельный контроль качества. Если слишком настойчиво уменьшать функцию управления, модель начинает выполнять формальный критерий ценой реалистичности результата. Авторы останавливали обучение по отложенной выборке или штрафовали слишком большие коэффициенты графика. Без такой проверки оптимизатор может улучшать целевую функцию одновременно с ухудшением визуального качества.

Метод также не ускоряет обычную генерацию без управления. Его область — задачи, где на каждом шаге уже вычисляется внешний градиент: восстановление изображений, соблюдение измерений, идентичность лица или физическое ограничение. В этом контуре LEEGS предлагает заменить ручной подбор постоянного коэффициента обучаемым графиком и тем самым сократить траекторию.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу