Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Условия генерации — метки классов и текстовые запросы — можно использовать не только на входе диффузионной модели, но и для упорядочивания её внутренних признаков во время обучения. CARE улучшил качество изображений и отдельно, и поверх REPA, хотя препринт не рецензирован и все числа в нём получили сами авторы. Метод добавляет одну целевую функцию и не требует менять архитектуру модели или процесс генерации.
CARE слабее расталкивает признаки с похожими условиями
Обычная дисперсионная регуляризация не даёт внутренним представлениям разных примеров схлопнуться в одну область. Она расталкивает признаки, но не учитывает, что два изображения могут относиться к одному классу или соответствовать близким текстовым запросам.
CARE сохраняет это расталкивание, но меняет его силу для каждой пары примеров в пакете. Для одинаковых меток классов штраф становится слабее. Для текста метод вычисляет косинусное сходство между уже имеющимися в модели векторами запросов: чем ближе условия, тем меньше признаки обязаны расходиться.
CARE не притягивает похожие примеры напрямую. Он слабее расталкивает их и тем самым оставляет модели возможность собрать признаки для близких условий в более плотные области. Это отличает метод от отдельной функции выравнивания, которая заставляла бы признаки копировать структуру внешней модели.
Итоговая целевая функция складывается из основной ошибки диффузионной модели и ошибки CARE с настраиваемым весом. Регуляризацию применяют к одному промежуточному слою. В экспериментах более глубокие слои давали лучший результат: их признаки ближе к выходу модели, поэтому новая структура меньше размывается последующими преобразованиями.
Для CARE не нужен дополнительный кодировщик. При генерации по классам достаточно меток, а при генерации по тексту используются те же векторы CLIP-L, которыми уже обусловлена модель. Если команда применяет REPA и внешний DINOv2 для выравнивания признаков, CARE можно добавить к той же целевой функции и на тот же слой.
Выигрыш сохранился на классах, тексте и вместе с REPA
Качество авторы измеряли через FID — расстояние между распределениями реальных и созданных изображений; меньшее значение означает, что наборы ближе. На ImageNet CARE снизил FID у SiT-XL/2 на 19,08% при одинаковом бюджете обучения. Модель с CARE также обошла базовую SiT-XL/2 после 2,4 миллиона шагов, тогда как базовую модель обучали 7 миллионов шагов.
В генерации по тексту CARE снизил FID на 16,61%. Одновременно выросла метрика CLIP-T, которая оценивает соответствие изображения текстовому запросу. Это важно для интерпретации результата: метод не просто приблизил общую статистику изображений к датасету, но и сохранил связь с заданным условием.
CARE дополнил REPA в обеих задачах. REPA выравнивает признаки диффузионной модели с признаками внешнего визуального кодировщика, а CARE организует их по встроенным условиям. Улучшение поверх REPA показывает, что эти функции не полностью дублируют друг друга.
Проверки охватили генерацию изображений по классам и тексту при разрешении 256×256. Для первой задачи использовали SiT на ImageNet, для второй — MMDiT на наборе из 595 тысяч изображений и подписей из CC3M. Сравнения проводили с базовыми моделями, дисперсионной регуляризацией и REPA; перенос на видео, звук и трёхмерный контент в работе не проверяли.
Когда CARE стоит включить в план обучения
Работа меняет план экспериментов для команд, которые обучают условную диффузионную модель и могут править её целевую функцию. CARE подходит как отдельная ветка проверки рядом с текущей конфигурацией: архитектура, датасет и алгоритм генерации остаются прежними, а условие уже присутствует в обучающем конвейере.
Начинать разумно с одного глубокого слоя и сравнивать CARE не только с базовой моделью, но и с обычным дисперсионным штрафом. Такой контроль отделит пользу структуры условий от общего эффекта расталкивания признаков. Вес CARE и степень ослабления штрафа для похожих условий придётся подбирать: оптимальные настройки в работе менялись после добавления REPA.
Метод не обещает ускорить саму генерацию: он действует во время обучения и не сокращает число шагов сэмплера. Потенциальная экономия возникает, если целевое качество достигается за меньшее число обучающих шагов. В работе не приведены замеры длительности шага и расхода памяти, поэтому выигрыш по GPU-часам нужно проверять на собственном размере пакета.
Для нового проекта CARE не служит причиной менять выбранную архитектуру. Для уже работающего SiT- или MMDiT-подобного конвейера это локальное изменение с понятным критерием успеха: FID должен снизиться, а соответствие условию — не ухудшиться. Наиболее убедительный результат пока относится именно к условной генерации изображений.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



