Журнал · Rit.work

Сбой атаки приняли за приватность обучающих данных

Адаптация атак на модели компьютерного зрения выявила до 6,59 раза больше утечек и вернула связь между восстановлением данных и устойчивостью модели.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Стандартные проверки защиты от восстановления обучающих изображений заметно занижают утечку данных. В препринте Dartmouth College, который не рецензировался и все числа для которого получили сами авторы, адаптированные атаки восстанавливали лица в 1,16–6,59 раза чаще. Для оценки такой защиты теперь недостаточно запустить опубликованную атаку с исходными настройками.

Атака инверсии модели пытается по параметрам классификатора восстановить узнаваемые примеры из его обучающих данных. Авторы сохранили целевую модель и генератор изображений, но заменили функцию потерь в атаке PPA и подняли скорость обучения в десять раз. Эти простые изменения помогли обходить защиты, которые меняют градиенты и тем самым мешают конкретной настройке оптимизатора, но не обязательно скрывают сведения об обучающих лицах.

На FaceScrub защита NegLS при стандартной атаке получила AttAcc@1 0,105, а после адаптации — 0,692. Эта метрика показывает долю реконструкций, для которых независимый классификатор поставил нужную личность на первое место. Значит, низкий исходный результат отражал не только приватность модели, но и то, что атака плохо проходила по изменённому пространству градиентов.

Результат зависит и от модели-оценщика. Для одних и тех же изображений, восстановленных из модели с состязательным обучением, стандартный Inception дал 0,430, а Inception, обученный противостоять намеренно искажённым примерам, — 0,901. Второй оценщик не считается эталоном: расхождение показывает, насколько вывод о приватности зависит от признаков, которые использует выбранный классификатор.

Проверка охватила защиты и обычные режимы обучения, включая MixUp и состязательное обучение, на FaceScrub и CelebA с ResNet-152 и DenseNet-169. Использовали PPA, а перенос изменений дополнительно проверили на IF-GMI. Сценарий предполагает полный доступ атакующего к модели, вспомогательные данные и генератор, поэтому вывод относится к проверке утечки при сильном противнике.

После адаптации атаки и смены оценщика устойчивость к состязательным примерам снова стала лучше предсказывать восстановление данных: качество связи выросло с 0,317 до 0,740. Практический вывод для аудита моделей — менять функцию потерь и настройки атаки, сравнивать несколько оценщиков и рассматривать высокую устойчивость как сигнал возможной уязвимости к реконструкции, а не как доказательство утечки само по себе.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу