Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Генеративную модель научили лучше следовать заданной награде без дорогих многошаговых прогонов во время дообучения. В препринте Abbas Mammadov и соавторов, который не прошёл рецензирование и приводит замеры самих авторов, метод WTF достиг результатов базовых подходов, затратив до 280 раз меньше вычислений. Для продукта это открывает прямой путь от ускоренной карты потока к дообученной модели с быстрым выводом.
WTF переносит образцы вместо перераспределения вероятностей
Обычный подход формулирует дообучение как поиск распределения, где образцы с высокой наградой встречаются чаще, а KL-дивергенция штрафует сильное отклонение от базовой модели. Такой наклон по награде меняет вероятности уже существующих областей распределения, но не перемещает каждый исходный образец к более подходящему результату.
Для детерминированной модели на основе потока эта схема создаёт лишний контур. Поток сначала превращают в диффузионный процесс, затем проводят стохастические траектории до конечного состояния, вычисляют награду и возвращают дообученную модель к детерминированному представлению. Значительная часть стоимости приходится на многократные вызовы сети вдоль каждой траектории.
WTF меняет само определение близости к базовой модели. Метод связывает каждый начальный шум с конечным образцом и ищет точку, где награда оправдывает отклонение от исходной динамики. Штраф зависит от энергии, которую нужно потратить, чтобы изменить скорость базового потока. Поэтому модель не просто повышает вероятность удачного режима, а может сдвигать отдельные образцы к соседним областям с более высокой наградой.
Авторы сводят эту задачу к детерминированному оптимальному управлению. К исходной скорости добавляется управляющий вектор, а целевая функция вычитает стоимость этого управления из конечной награды. В результате дообученная модель остаётся единым потоком, а не композицией базового генератора и дополнительного преобразования.
Ключевой компонент — заранее обученная карта потока (flow map), которая умеет сразу переходить между удалёнными моментами траектории. Для оценки будущей награды WTF использует два вызова такой карты и одно обратное распространение через матрицу производных. Стоимость оценки не растёт вместе с числом промежуточных шагов, отдельная модель-критик не нужна. «Без моделирования» здесь означает отказ от пошагового численного прохождения всей траектории, а не отказ от генерации образцов.
Один контрольный модуль работает при разном бюджете вывода
Метод проверяли на классовой генерации ImageNet-256 и генерации изображений по тексту с TiM-T2I. В обеих задачах модель дообучали по HPSv2 — оценке, которая приближает человеческие предпочтения. Сравнения проводили при согласованных вычислительных бюджетах или в одном контуре оценки, в зависимости от эксперимента.
В генерации по тексту WTF превысил Adjoint Matching по HPSv2 примерно на 11% при одинаковом бюджете вывода. На ImageNet в одношаговом режиме преимущество над VFM составило около 4%. Один и тот же дообученный контрольный модуль работал во всём диапазоне от одного до 250 вызовов сети, поэтому для ускоренного и более точного режимов не потребовались разные контрольные точки.
WTF также сохранил быстрый вывод без последующей дистилляции. Это отличает его от контура, где сначала дообучают дорогой многошаговый генератор, а затем отдельно переносят его поведение в ускоренную модель. При этом повышение награды могло снижать разнообразие изображений: масштаб награды остаётся параметром, который задаёт компромисс между двумя целями.
Экономия начинается только с готовой карты потока
Работа меняет планы команд, у которых карта потока уже входит в целевую архитектуру. В таком случае её можно использовать не только для быстрого вывода, но и как инфраструктуру дообучения: модель быстро строит конечные состояния, получает градиент награды и сохраняет тот же интерфейс после обновления весов.
Наиболее прямой сценарий — генератор изображений с дорогой функцией награды и несколькими режимами задержки. WTF позволяет обучить один поток, а при эксплуатации выбирать малый бюджет для интерактивного интерфейса и больший — для пакетной генерации. Отдельно дистиллировать каждую дообученную версию не требуется.
Если команда располагает только моделью скорости, сначала придётся получить карту потока. Стоимость этой предварительной дистилляции в сравнительные замеры не вошла, поэтому переносить заявленную экономию на такой проект напрямую нельзя. Теоретическая гарантия улучшения также относится к распределению в целом, тогда как крупные эксперименты используют приближённый градиент награды.
Практический вывод уже: WTF не заменяет общий стек дообучения генеративных моделей, но делает карту потока архитектурным решением сразу для двух стадий. Если она нужна только ради вывода, работа добавляет аргумент учитывать её ещё до выбора контура обучения под награду.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



