Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Расписание обучения и генерации научились подстраивать под то, где модель чаще ошибается. В препринте команды LMU Munich, который не прошёл рецензирование и приводит замеры самих авторов, такое расписание снизило FID на 38,6% при 16 вызовах модели для согласования потоков на CIFAR-10. Метод не меняет архитектуру или траекторию смешивания данных с шумом, но требует обучить модель заново.
Как ошибка превращается в профиль риска
Диффузионная модель постепенно смешивает исходные данные с шумом, а затем учится двигаться в обратную сторону. Расписание задаёт коэффициенты сигнала и шума для каждого момента этого процесса. Стандартные варианты выбирают скорость движения по траектории без учёта того, насколько хорошо конкретная модель предсказывает нужную величину.
Авторы рассматривают состояние, в котором сигнал и шум уже сложены. Одно и то же состояние можно разложить на эти компоненты несколькими способами. Множество совместимых разложений они называют волокном: все его точки дают одну и ту же сумму, но по-разному распределяют её между сигналом и шумом.
Модель также выдаёт своё разложение текущего состояния. Метод измеряет расстояние между истинным и предсказанным разложениями внутри одного волокна с помощью оптимального транспорта. Такое сравнение не сдвигает само распределение состояний и отделяет ошибку предсказателя от геометрии траектории.
При прямом предсказании шума риск сводится к среднеквадратичной ошибке, умноженной на квадрат текущего коэффициента шума. Для других линейных целей, включая скорость, меняется формула пересчёта, но измеряется та же ошибка разложения. Поэтому подход применим и к DDPM, и к согласованию потоков.
Профиль риска не нужно оценивать на полностью обученной модели. Достаточно взять раннюю контрольную точку базового обучения, прогнать данные через модель и измерить ошибку вдоль исходного расписания. После этого профиль фиксируют и используют для одного пересчёта расписания.
Почему трудным участкам дают меньше времени
Метод сохраняет исходную кривую коэффициентов сигнала и шума, но меняет скорость движения по ней. Для сравнения разных моделей кривую сначала переводят в координату, где базовое расписание проходит её с постоянной кинетической скоростью. Это убирает различия, связанные только с тем, как системы нумеруют время.
Новое распределение времени выводится аналитически из двух слагаемых. Первое не позволяет проходить кривую слишком резко, второе штрафует время, проведённое в областях с высоким риском. В результате расписание быстрее проходит участки, где предсказатель ошибается сильнее, и отдаёт больше времени надёжным участкам.
Это может показаться обратным интуиции: сложному месту обычно хочется выделить больше вычислений. Но здесь речь не о дополнительных шагах численного решателя во время генерации. Расписание определяет, какие состояния модель чаще видит при обучении и как затем проходит ту же траекторию; долго оставаться в области с высокой ошибкой означает сильнее опираться на ненадёжное предсказание.
Нормированные профили риска оказались похожими у независимо обученных моделей, разных целей предсказания и архитектур. На CIFAR-10 аналитический шаблон, построенный из общей формы профиля, сохранил от 75,8 до 98,1% выигрыша специализированных расписаний. Он не требует отдельно оценивать риск и подгонять форму под каждую модель, хотя специализированный вариант дал дополнительный выигрыш для согласования потоков.
Когда стоит менять план разработки
Работа предлагает не замену архитектуры, функции потерь или численного решателя, а отдельную точку оптимизации. Команда может оставить коэффициентную кривую и остальной конвейер без изменений, оценить профиль по ранней контрольной точке, пересчитать распределение времени и повторить обучение. Такой эксперимент удобно проводить как изолированное сравнение с базовым расписанием.
Для уже обученной модели метод пока не выглядит способом улучшить генерацию одной заменой сетки шагов. В экспериментах новое расписание применяли и при повторном обучении, и при генерации. Диагностика крупных условных DiT и InstaFlow 2-RF показала сходную форму риска, но эти модели с новым расписанием целиком не переобучали.
Основные проверки качества провели на безусловной генерации изображений с DDPM и согласованием потоков, используя CIFAR-10 и ImageNet-64. Авторы меняли цели предсказания, архитектуры, настройки обучения, контрольные точки для оценки риска и численные решатели. Это подтверждает переносимость внутри изученного класса задач, но ещё не показывает эффект на больших условных моделях после полного обучения.
Если продукт обучает диффузионную или потоковую модель с нуля, расписание становится ещё одним контролируемым параметром с понятной процедурой оценки. Если команда только обслуживает готовую модель через API или меняет число шагов генерации, работа сама по себе план не меняет: её результат связан прежде всего с обучением, а не с настройкой уже развёрнутого решателя.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



