Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Проверки генеративных моделей могут принять обычное сходство с обучающими данными за дословное копирование. После калибровки аудит подтвердил запоминание 36 из 61 изображения MemBench при допустимой доле ложных находок в 5%; поскольку это нерецензированный препринт, все числа получили сами авторы. Для команд меняется не обучение модели, а способ доказывать, что она воспроизводит конкретные данные.
Перестановка меток отделяет копирование от общего сходства
Обычный аудит вычисляет сходство генерации с обучающим изображением и сравнивает результат с выбранным порогом. Сам порог не показывает, как часто такой результат возникает у модели, которая ничего не копирует. Без этого контрольного распределения нельзя оценить вероятность ложного срабатывания.
Проблема особенно заметна у моделей, которые хорошо передают распределение данных. Их результаты естественным образом ближе к плотным областям обучающей выборки, чем случайные контрольные изображения. Тест ближайшего соседа может назвать это запоминанием, хотя модель предпочитает не конкретные файлы, а типичные изображения своего домена.
Для проверки всей модели работа предлагает случайно менять местами метки обучающих и отложенных изображений. Если отложенную часть заранее получили случайным разделением одного набора, обе группы взаимозаменяемы для модели, которая не запомнила конкретные примеры. Многократная перестановка показывает, насколько необычна фактическая разница между группами.
Такой тест подходит для любой меры сходства, но выбранная мера определяет смысл результата. Близость к обучающей выборке выявляет и копирование, и более мягкое переобучение. Чтобы проверять именно воспроизведение, авторы ограничивают измерение масштабом почти идентичных изображений и суммируют число пересечений на нескольких близких порогах.
На наборе генераторов все четыре модели, которые действительно воспроизводили данные, обнаружили все варианты теста. Среди 24 моделей без копий ближайший сосед всё же отклонил нулевую гипотезу у семи, а мера на масштабе почти точных копий — ни у одной. Ещё одну модель с редкими копиями вынесли из этого сравнения как пограничную.
Для отдельного изображения нужен сопоставимый контроль
Переставить метки нельзя, когда аудит проверяет одно предполагаемое обучающее изображение. Для него результат сравнивают с контрольными изображениями, которые модель не запомнила и для которых генерации получили тем же способом. Позиция кандидата среди контрольных результатов превращается в вероятность ложного срабатывания.
Случайный набор картинок для этого не подходит. Если кандидат и запрос связаны по смыслу, а контрольные изображения — нет, тест измерит семантическое совпадение вместо копирования. Независимое повторное создание генераций тоже искажает фон: в экспериментах такое контрольное распределение оказалось втрое уже нужного и делало подозрительные результаты искусственно редкими.
После сопоставления контрольных запросов аудит применяет процедуру Benjamini–Hochberg. Она ограничивает ожидаемую долю ошибочно отмеченных изображений среди всех отмеченных, а не гарантирует правильность решения для каждого файла. Поэтому результат следует формулировать как свойство выбранного набора кандидатов, а не как безусловное доказательство для отдельной картинки.
Метод проверяли на небольших диффузионных моделях для CIFAR-10, на вариационных автоэнкодерах, генеративно-состязательных сетях и на Stable Diffusion с MemBench. Для CIFAR-10 отложенные данные можно было получить случайным разделением, поэтому перестановочный тест там точен по построению. Для Stable Diffusion использовали подобранные контрольные изображения, и взаимозаменяемость остаётся предположением, которое контрольная группа лишь помогает проверить.
Командам стоит менять протокол аудита, а не архитектуру
Работа не предлагает новый способ обучения или защиты модели. Она меняет требования к эксперименту, которым команда подтверждает эффект дедупликации, фильтрации данных или другой меры против запоминания. Падения числа результатов выше фиксированного порога для такого вывода недостаточно.
Если доступен обучающий набор, полезно заранее выделить случайную контрольную часть и не показывать её модели. Тогда различие между обучающими и отложенными изображениями можно проверять перестановкой меток без повторного обучения и без добавления специальных меток в данные.
Для аудита отдельных изображений нужны сопоставимые контрольные запросы и одинаковая процедура генерации. При массовой проверке следует ограничивать долю ложных находок, а метрику выбирать под утверждение: близость подходит для поиска общего переобучения, малый масштаб — для почти точного воспроизведения.
Метод требует доступа к обучающим изображениям и проверяет заранее собранный список кандидатов. Поэтому он даёт нижнюю оценку обнаруживаемого запоминания, а не доказывает, что других копий у модели нет. Командам, которые выпускают закрытую модель без доступа к её данным, такой протокол напрямую не поможет; владельцам модели он позволяет отделить копирование файлов от общего сходства с доменом.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



