Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Генеративную модель предложили донастраивать под сложное предпочтение в два раздельных этапа: сначала выбрать желаемое распределение результатов, затем обучить модель ему следовать. FTFC оказался до 20 раз быстрее прежних методов, хотя работа не рецензирована и все числа получили сами авторы. Для команды это превращает повторную оптимизацию по награде в расчёт весов на сохранённых примерах и один обычный этап обучения.
Целевое распределение выбирают до обучения генератора
Обычная донастройка повышает среднюю награду: например, делает среднее изображение эстетичнее или среднюю молекулу стабильнее. Но продукту может требоваться другое распределение результатов — меньше провалов, больше редких удачных образцов, сохранение разнообразия или соблюдение нескольких ограничений одновременно.
Такие предпочтения зависят не только от отдельного результата, но и от всей совокупности результатов. Поэтому эффективная награда меняется вместе с моделью. FDC решает эту проблему чередованием пересчёта награды и донастройки генератора, а TFFT разделяет этапы только для CVaR — среднего значения в выбранном хвосте распределения — и регуляризации через KL.
FTFC переносит разделение на более широкий класс вогнутых функций полезности и мер расхождения. Метод ищет, как перераспределить вероятность относительно исходной модели: каждому сохранённому результату назначается нормированный вес. Большой вес означает, что донастроенная модель должна выдавать похожие результаты чаще, малый — реже.
- Исходная модель создаёт банк результатов. Для них заранее считают награды и признаки, от которых зависит функция полезности.
- Двойственная задача Фенхеля совместно находит эффективную награду и веса. Она учитывает ограничение: средний вес должен сохранять полную вероятность распределения.
- Веса фиксируют. Генератор донастраивают через его обычную функцию потерь для удаления шума или согласования потока, умножая потерю каждого результата на соответствующий вес.
Во время последнего этапа FTFC добавляет свежий шум, а не переиспользует старые траектории генерации. Поэтому не нужно вычислять градиент награды или проводить обратное распространение через весь процесс сэмплирования. Для KL веса имеют экспоненциальную форму; другие меры расхождения задают иные правила, поэтому просто нормировать произвольные веса после расчёта нельзя.
Выбор меры расхождения меняет характер результатов
Работа Maksim Bobrin, Maksim Zhdanov и Dmitry Dylov проверяет FTFC на синтетическом распределении с кольцами, генерации изображений и молекулярном дизайне. В опытах использовали диффузионные и потоковые модели, включая Stable Diffusion и FlowMol3, а сравнивали с FDC, ITM, TFFT и донастройкой по ожидаемой награде.
На GEOM-Drugs FTFC получил среднюю награду 75,3 против 70,6 у лучшей сравниваемой донастройки, сохранив валидность молекул на уровне 99,9%. Эта награда имеет внутреннюю шкалу теста, поэтому значение имеет сравнение методов при одном протоколе, а не само число.
Мера расхождения оказалась не формальной настройкой. Cressie-Read-3 дал хвостовую награду 96,3, тогда как KL — 95,0. KL при этом лучше сохранил средний результат и корректность топологии. Значит, выбор регуляризации определяет, будет модель улучшать типичный образец или сильнее переносить вероятность к редким удачным образцам.
Небольшое преимущество FTFC над исходной моделью по топологии статистически не подтверждено. Теоретические гарантии также относятся к вогнутым функциям полезности при заданных условиях и предполагают конечный банк примеров; ошибки оценки на таком банке и неточное обучение генератора в доказательство не входят.
Когда FTFC меняет план разработки
Схема подходит командам, у которых уже есть предобученная диффузионная или потоковая модель, результаты можно оценить заранее, а цель зависит от распределения. Это относится к контролю нижнего хвоста качества, поиску редких кандидатов, поддержанию покрытия и сочетанию награды со штрафами за нежелательные свойства.
Главное архитектурное следствие — функцию полезности можно вынести из цикла обучения генератора. Её параметры и веса рассчитывает отдельный сравнительно дешёвый этап, после чего инфраструктура использует штатную функцию потерь модели. Не требуется внедрять дифференцируемую награду или хранить вычислительный граф всей генерации.
Метод не создаёт образцы за пределами покрытия исходной модели: он перераспределяет вероятность между областями, уже представленными в банке. Если нужный класс результатов туда не попал, весовая коррекция его не восстановит. При постоянно меняющейся награде банк и веса придётся обновлять.
В расчёт бюджета нужно включать создание и оценку банка. Замеры активного времени на GEOM-Drugs рассматривают в том числе сценарий, где общий корпус уже доступен; для нового продукта стоимость его получения может изменить итоговое сравнение. Поэтому FTFC скорее упрощает повторную адаптацию существующего генератора, чем заменяет сбор данных или обучение базовой модели.
Источники
Иллюстрация: рисунок из статьи «Fenchel Tilting: Weighted Correction for Efficient Finetuning of Generative Models», Maksim Bobrin, Maksim Zhdanov, Dmitry Dylov, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



