Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
У уже обученных генераторов синтетических таблиц научились перехватывать строки, похожие на обучающие записи, и исправлять их перед выдачей — без обновления весов. PEG-Tab снизил среднюю долю близких копий с 7,8% до 2,7%; работа не рецензирована, а замеры выполнили сами авторы. Такой слой можно добавить к существующему генератору, если переобучать его слишком дорого или нельзя.
Сначала генератор создаёт строку, затем PEG-Tab определяет поля, которые сильнее всего повышают риск утечки. В расчёт входят точное совпадение, редкие сочетания значений, близость к обучающим строкам и повышенная плотность записей вокруг них. После этого система создаёт две исправленные версии, сравнивает три варианта и либо выпускает лучший, либо повторяет процедуру — не более трёх раз.
Способ исправления зависит от генератора. GReaT меняет выбор токенов, CTGAN и TVAE корректируют скрытое представление строки, а TabDDPM повторно генерирует отмеченные поля на обратном ходе диффузии. Поэтому PEG-Tab требует доступа к обучающей таблице и внутреннему процессу генерации: подключить его только через внешний API без доступа к состоянию модели не получится.
Точные копии в общем замере исчезли. По сравнению с фильтром, который создавал втрое больше строк и затем отбраковывал рискованные, PEG-Tab сохранил более высокое прикладное качество в 12 из 16 проверок. В половине проверок он одновременно лучше сохранял качество и не увеличивал долю близких копий.
Метод проверили на пяти наборах данных и четырёх семействах генераторов. Настройки выбрали на South German Credit, затем без изменений перенесли на остальные наборы: доля близких копий нигде не выросла. Однако независимая атака на определение принадлежности строки к обучающим данным не стала слабее, поэтому PEG-Tab снижает риск прямого копирования, но не даёт формальной приватности. Если исходный генератор почти не копирует записи, обычный фильтр или неизменённая выдача могут сохранить больше качества.
Источники
Иллюстрация: рисунок из статьи «PEG-Tab: Sampling-Time Record Repair and Release Control for Tabular Synthesis», Pengfei Li, QinYi Liu, Mohammad Khalil, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



