Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Дообучение LLM на закрытых записях можно ограничить так, чтобы модель реже воспроизводила отдельные данные, но сохраняла пользу от обучения. В препринте TRAP запоминание приблизили к уровню недообученной модели, хотя работа не рецензирована и все числа получили сами авторы. Метод подходит для сценариев с медицинскими картами, анкетами и другими документами, но требует второй модели и меняет процесс обучения.
Как TRA отделяет общее знание от отдельной записи
Обычная вероятность токена плохо показывает, что именно выучила модель. Высокая вероятность фамилии может означать знание языка, закономерность предметной области или запоминание конкретного документа.
Метрика TRA сравнивает две одинаковые модели. Корпус случайно делят на равные части: целевую модель обучают на одной, эталонную — на другой, сохраняя архитектуру и настройки. Затем для каждого проверяемого токена сравнивают логарифмы вероятностей, которые назначили обе модели.
Если модели одинаково хорошо предсказывают токен, он, вероятно, отражает общую закономерность корпуса. Положительное преимущество целевой модели указывает на информацию, которую поддерживают только её обучающие записи. TRA можно считать для конкретного имени, адреса или диагноза, а не усреднять риск по документу.
Для аудита чувствительные позиции нужно знать заранее. Для защиты это не требуется: TRAP применяет штраф ко всем токенам, на которых целевая модель опережает эталонную больше заданного порога. Штраф односторонний, поэтому общие для обеих частей корпуса закономерности продолжают влиять на обучение.
Эталонную модель сначала обучают обычным способом и замораживают. Во время дообучения целевой модели она вычисляет вероятности тех же токенов. Авторы также предлагают заранее сохранить эти вероятности, если обучающий корпус не меняется.
Почему ранняя остановка не закрывает редкие утечки
Запоминание продолжает расти после момента, когда ошибка на проверочной выборке достигла минимума. В экспериментах рост сохранялся примерно до десятикратного числа эпох относительно лучшей контрольной точки, а затем выходил на плато. Поэтому ранняя остановка заметно снижает риск, но не устраняет его.
Причина в том, что проверочная ошибка усредняет поведение модели. Редкий идентификатор почти не влияет на общую метрику, особенно если остальной текст предсказывается хорошо. Модель может запомнить такой фрагмент раньше, чем проверочная ошибка подаст сигнал остановиться.
Риск также рос на малых наборах данных, при повышенной скорости обучения и на задачах, где ответ нельзя вывести из остальных полей записи. Размер модели сам по себе не показал устойчивой связи с запоминанием, если обучение останавливали в лучшей контрольной точке.
Для сравнения моделей использовали четыре оценки атак. Основная сводная метрика принимает ноль при случайном различении обучающих и отложенных фрагментов и единицу, когда их можно разделить без ошибки. TRAP приблизил результат к уровню исходной модели, тогда как общие способы регуляризации не дали такого же соотношения между утечкой и качеством.
Дифференциальная приватность сильнее ухудшала полезность дообучения. В одном опыте на MedCase ошибка предсказания DP-AdamW достигла 5,9 нат против 2,28 у модели без защиты — примерно в 2,6 раза выше. Меньшая ошибка здесь означает, что модель лучше решает исходную задачу.
Что TRAP меняет в плане дообучения
Работу проверяли на студенческих эссе с размеченными персональными данными, синтетических анкетах соискателей и медицинских случаях с идентификаторами пациентов. В эксперименты вошли модели от Pythia-70M до Llama-3.1-8B-Instruct. Утечку оценивали по чувствительным фрагментам, а полезность — по ошибке на отложенных данных и точности исходных задач.
Самое простое изменение процесса уже доступно без TRAP: выбирать контрольную точку по проверочной ошибке и не продолжать обучение после неё. Это не защищает редкие фрагменты, но убирает часть запоминания, которое появляется при переобучении.
Для TRAP придётся поддерживать две совместимые обучающие ветки и делить данные на непересекающиеся части. Дополнительный проход эталонной модели увеличивает вычисления на шаге не более чем примерно на треть; предварительный расчёт вероятностей переносит эти затраты до основного запуска. В испытанной схеме целевая модель видит одну часть записей, а эталонная — другую, что нужно учитывать при подготовке корпуса и оценке качества.
Метод имеет смысл включать в экспериментальный контур, если команда дообучает LLM на документах с неразмеченными персональными полями и обычная ранняя остановка не даёт приемлемого риска. TRA также подходит для внутреннего аудита: она показывает не только среднюю утечку, но и конкретные токены, на которых модель оторвалась от эталона.
TRAP пока не заменяет проверку приватности перед выпуском. Работа измеряет запоминание через несколько атак и специальные тестовые задачи, а не задаёт гарантированную границу утечки для произвольного запроса. Практический план — оставить раннюю остановку обязательной, сравнить TRAP с базовым дообучением на собственных типах секретов и отдельно провести атаки на готовую модель.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



