Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Влияние отдельной обучающей записи научились удалять без повторного обучения всей модели для большинства запросов. Как показывают авторские замеры в пока не рецензированной работе Meta, QSS сокращает ожидаемую задержку удаления в 4–483 раза относительно SISA на задачах с небольшим числом классов. Это позволяет заложить точное удаление данных в архитектуру продукта, а не добавлять его после обучения.
Точное удаление здесь означает, что результат побитово совпадает с моделью, которую заново обучили без указанной информации. QSS делит модель на замороженную схему и изменяемое содержимое. Схема задаёт базовый прогноз и распределяет похожие входы по ячейкам, а содержимое хранит в этих ячейках суммы ошибок прогноза, счётчики и статистику совместного попадания.
При обычном запросе QSS вычитает вклад записи из накопленных величин и пересчитывает средние по затронутым ячейкам. Стоимость такой операции не зависит от объёма датасета. Если запись попала в небольшую случайно выбранную часть, на которой построена схема, требуется полная пересборка; при доле схемы 0,5% этот случай включён в опубликованные оценки задержки.
Режим QSS-L удаляет метку, но сохраняет сам вход: квантователь может учитывать его признаки, поскольку обучается без меток. QSS-E удаляет и вход, и метку, поэтому строит схему только на удерживаемой части данных; гарантия строже, но качество ниже. SISA решает ту же задачу иначе — делит датасет на независимые сегменты и при каждом запросе переобучает затронутый сегмент.
Проверка охватила 15 наборов изображений, текстов и табличных данных. QSS-L отстал от SISA не более чем на два процентных пункта в 11 задачах, но граница метода проявилась на ImageNet: при большом числе классов разрыв достиг 15,6 пункта. Практический сценарий QSS — классификация с небольшим числом классов и частыми запросами на отзыв меток; для полного удаления записей или многоклассовых задач придётся отдельно проверять компромисс между качеством, размером схемы и частотой пересборок.
Источники
Иллюстрация: рисунок из статьи «Exact Unlearning via Quantized Sufficient Statistics», Ami Tavory, Shripad Gade, Tal Sarig и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



