Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Стандартные проверки защиты от восстановления обучающих изображений заметно занижают утечку данных. В препринте Dartmouth College, который не рецензировался и все числа для которого получили сами авторы, адаптированные атаки восстанавливали лица в 1,16–6,59 раза чаще. Для оценки такой защиты теперь недостаточно запустить опубликованную атаку с исходными настройками.
Атака инверсии модели пытается по параметрам классификатора восстановить узнаваемые примеры из его обучающих данных. Авторы сохранили целевую модель и генератор изображений, но заменили функцию потерь в атаке PPA и подняли скорость обучения в десять раз. Эти простые изменения помогли обходить защиты, которые меняют градиенты и тем самым мешают конкретной настройке оптимизатора, но не обязательно скрывают сведения об обучающих лицах.
На FaceScrub защита NegLS при стандартной атаке получила AttAcc@1 0,105, а после адаптации — 0,692. Эта метрика показывает долю реконструкций, для которых независимый классификатор поставил нужную личность на первое место. Значит, низкий исходный результат отражал не только приватность модели, но и то, что атака плохо проходила по изменённому пространству градиентов.
Результат зависит и от модели-оценщика. Для одних и тех же изображений, восстановленных из модели с состязательным обучением, стандартный Inception дал 0,430, а Inception, обученный противостоять намеренно искажённым примерам, — 0,901. Второй оценщик не считается эталоном: расхождение показывает, насколько вывод о приватности зависит от признаков, которые использует выбранный классификатор.
Проверка охватила защиты и обычные режимы обучения, включая MixUp и состязательное обучение, на FaceScrub и CelebA с ResNet-152 и DenseNet-169. Использовали PPA, а перенос изменений дополнительно проверили на IF-GMI. Сценарий предполагает полный доступ атакующего к модели, вспомогательные данные и генератор, поэтому вывод относится к проверке утечки при сильном противнике.
После адаптации атаки и смены оценщика устойчивость к состязательным примерам снова стала лучше предсказывать восстановление данных: качество связи выросло с 0,317 до 0,740. Практический вывод для аудита моделей — менять функцию потерь и настройки атаки, сравнивать несколько оценщиков и рассматривать высокую устойчивость как сигнал возможной уязвимости к реконструкции, а не как доказательство утечки само по себе.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



