Журнал · Rit.work

Коллапс диффузионных моделей начинается с отдельных признаков

При фиксированном бюджете обучения диффузионная модель быстро забывает редкие признаки, но может сохранять устойчивые на протяжении почти неограниченного числа поколений.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Накопление исходных и синтетических данных при неизменном размере обучающей выборки сохраняет одни признаки диффузионной модели, но быстро стирает другие. В работе Hanna Malet и Gabriel Turinici, которая не рецензирована, а все числа получили сами авторы, устойчивый признак терял половину исходного вклада за 7,12 × 1029 поколений вместо 69 при полной замене данных. Для обучающих конвейеров это означает, что частичный коллапс может долго оставаться незаметным.

Авторы сравнили два сценария. В первом каждое новое поколение модели учится только на данных предыдущего. Во втором исходные и синтетические наборы остаются в общем пуле, но модель каждый раз получает выборку фиксированного размера. Доля реальных примеров постепенно стремится к нулю, хотя сами примеры не удаляют.

При полной замене вклад любого исходного признака со временем исчезает. Фиксированный бюджет меняет динамику: чувствительные признаки теряются за несколько поколений, а устойчивые сохраняются практически неограниченно. Математическая модель связывает скорость распада с тем, насколько обучение зависит от конкретного направления в параметрах модели. При этом связь таких направлений с понятными человеку свойствами изображения остаётся интерпретацией.

В экспериментах полная замена быстро превращала результаты в почти белый шум. При фиксированном бюджете модели сохраняли структуру цифр в MNIST, форму одежды в Fashion-MNIST и текстуры сцен в CIFAR-10, хотя расстояние от исходного распределения продолжало расти.

Проверка охватывала двумерную спираль и три набора изображений. Небольшие модели обучали с нуля на выборках примерно по 10 тысяч примеров на протяжении от 20 до 100 поколений. Такой масштаб не описывает крупные предобученные модели, но показывает риск для практического конвейера: хранение реальных данных само по себе не защищает редкие случаи, если они всё реже попадают в очередную выборку. Их нужно целенаправленно возвращать в обучение до того, как модель начнёт воспроизводить только устойчивую часть распределения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу