Журнал · Rit.work

RWTD дообучает одношаговые генераторы без траектории шумоподавления

RWTD смешивает знания исходного генератора с улучшениями текущей модели и позволяет дообучать её по числовой награде без доступной функции правдоподобия.

Rit.work
Студия разработки
28 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Одношаговые генераторы изображений научились дообучать под оценку результата, используя только созданные образцы и числовую награду. В нерецензированном препринте, где числа получили сами авторы, метод RWTD поднял оценку GenEval с 0,73 до 0,80. Это даёт командам способ менять поведение быстрой модели, даже если через функцию награды нельзя передавать градиент.

Почему одношаговую модель трудно направить после обучения

Одношаговый генератор создаёт изображение за один запуск нейросети. Такая схема сокращает путь от запроса до результата, но убирает промежуточную траекторию шумоподавления, на которую опираются многие методы дообучения диффузионных моделей.

У неявного генератора также может не быть доступной функции правдоподобия. Она показывала бы, насколько вероятным модель считает конкретное изображение, но здесь напрямую вычислить эту величину нельзя. Дополнительную проблему создают функции награды, через которые невозможно передать градиент: например, внешний оценщик может вернуть только итоговый балл.

RWTD обходит эти ограничения. Методу нужны изображения, созданные моделью, и скалярная награда — одно число для каждого результата. Он не требует ни вычислять правдоподобие, ни восстанавливать последовательность шагов генерации, ни дифференцировать сам оценщик.

Обычная схема выравнивания по награде строит цель вокруг опорного распределения, то есть поведения исходной предобученной модели. Она повышает вес результатов с подходящей наградой, но остаётся привязана к тому, что уже умела исходная версия. RWTD добавляет второе распределение — текущее поведение модели в процессе дообучения.

Как RWTD смешивает исходные знания и новые находки

Метод отдельно смещает по награде опорное и текущее распределения. Опорная часть удерживает цель рядом с предобученным генератором, а текущая часть включает удачные изменения, которые появились уже во время обучения.

Затем RWTD смешивает эти две части в адаптивную цель. Модель не должна ни полностью копировать исходную версию, ни учиться только на собственных свежих результатах. Первая крайность мешает закреплять новые улучшения, а вторая может вытеснить способности, полученные при предварительном обучении.

Для переноса к этой цели метод сопоставляет образцы через оптимальный перенос в пространстве признаков. Изображения при этом сравниваются не как массивы отдельных пикселей, а через их представления в признаковом пространстве. После сопоставления RWTD использует регрессию к неподвижной точке — состоянию распределения, которое перестаёт меняться при повторении шага обучения.

Теоретический разбор связывает такие неподвижные точки с двумя режимами. На одном краю модель ориентируется на примеры опорного генератора, перевзвешенные наградой; на другом — на собственные текущие примеры. RWTD занимает промежуточное положение и тем самым формализует компромисс между адаптацией к награде и сохранением прежних знаний.

Точная процедура построения соответствий, выбора смеси и регрессии из доступного описания не восстанавливается. Абстракт позволяет понять устройство цели, но его недостаточно, чтобы независимо реализовать алгоритм без дополнительных деталей.

Прирост GenEval получили на одношаговой модели SANA Sprint 1.6B. В отдельных опытах по выравниванию предпочтений улучшения переносились между разными функциями награды, а модель сохраняла способность составлять в одном изображении несколько объектов и отношений между ними. Метрики этих дополнительных опытов в абстракте не приведены.

Меняет ли RWTD планы продуктовой команды

Работа расширяет набор вариантов для команд, которые уже выбрали одношаговый генератор и могут оценивать его ответы одним числом. Для такого продукта отсутствие траектории шумоподавления больше не закрывает дообучение по внешнему оценщику: RWTD работает с готовыми образцами и их баллами.

Практический смысл смеси особенно заметен там, где одной награды недостаточно для описания качества. Если оптимизировать только предпочтение пользователей или отдельный автоматический показатель, модель может потерять другие свойства. Опорная часть цели RWTD служит якорем, а текущая позволяет не отбрасывать улучшения, найденные после запуска обучения.

Проверка охватывает один генератор изображений, GenEval и отдельные опыты с предпочтениями; поскольку материал подготовлен по абстракту, а не по полному тексту, сравнения с другими методами и подробный протокол оценить нельзя. Работа поэтому даёт основание добавить RWTD в план экспериментов, но не выбирать по ней архитектуру, вычислительную инфраструктуру или бюджет обучения.

Для команды с уже работающим SANA Sprint или другим неявным одношаговым генератором вывод конкретнее: можно проверять выравнивание без замены модели на многошаговую. Если же проект ещё выбирает основу, препринт не доказывает, что одношаговая схема в целом лучше альтернатив; он снимает только одно возражение — сложность дообучения при недифференцируемой награде.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу