Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Открытую LLM научились заранее делать менее восприимчивой к дообучению на запрещённой области, а не только скрывать уже выученные ответы. В препринте, который не проходил рецензирование и где числа получили сами авторы, метод GSU снизил точность запрещённых ответов на WMDP Bio с 65,36 до 34,13. Для поставщика открытых весов это новый этап подготовки модели перед выпуском: защищать нужно не только её ответы, но и пути будущего обучения.
Почему подавить ответы недостаточно
Обычное забывание работает с уже известным поведением. Метод получает примеры, которые модель должна забыть, снижает вероятность нежелательных ответов и одновременно старается сохранить качество на обычных задачах.
Такая модель может перестать выдавать запрещённые сведения, но остаться готовой быстро освоить их снова. Дообучение меняет параметры через градиенты — сигналы, которые показывают, в какую сторону сдвигать веса. Если чувствительные к запрещённой области внутренние каналы продолжают проводить эти сигналы, новых данных достаточно, чтобы вернуть навык.
На TOFU это видно у NPO: показатель извлечения целевых фактов вырос после атаки с 0,112 до 0,326. Низкий результат при выпуске поэтому не говорит, насколько легко модель обучится после передачи весов пользователю.
Работа формулирует другую задачу — упреждающее забывание (preemptive unlearning). Защитник до выпуска знает запрещённую область и располагает её приблизительной выборкой, но не знает будущих данных, режима обучения и оптимизатора пользователя. Модель должна сопротивляться такому дообучению и при этом сохранять полезность на обычных задачах.
Как GSU перекрывает градиент
GSU сначала создаёт временную копию исходной модели и дообучает её на приблизительной выборке запрещённой области. Это пробное обучение не входит в итоговую модель: оно показывает, какие каналы в слоях многослойного перцептрона сильнее всего реагируют на приобретение нового навыка.
Метод сравнивает внутренние значения до и после пробного обучения и выбирает каналы с заметным ростом предактиваций — сигналов перед функцией активации. Выбранные каналы совпадали с теми, которые позднее сильнее менялись при независимой атаке. Когда исследователи полностью ослабили градиент только в верхней десятой части найденных каналов, прирост запрещённой способности сократился на 24,35%.
После поиска GSU отбрасывает временную копию и снова начинает с исходных весов. При итоговом обучении метод сдвигает предактивации выбранных каналов в отрицательную область. Там функция активации SiLU имеет почти нулевую производную, поэтому через канал проходит слабый градиент и последующему дообучению труднее его использовать.
Одновременно GSU подавляет запрещённые ответы и обучается на разрешённых данных. Первый компонент закрывает внутренний путь, второй улучшает состояние модели при выпуске, третий не даёт защите разрушить обычные возможности. Прямо штрафовать все градиенты не требуется: метод использует обычные производные первого порядка.
Для открытых весов появляется дополнительный рубеж, но не гарантия
GSU проверили на TOFU и WMDP Bio/Cyber с моделями семейств Llama-3.2 и Qwen3.5. Приблизительные данные защитника и данные атаки не пересекались, а среди соперников были NPO, RMU, GradDiff и другие методы ретроспективного забывания.
На WMDP Cyber точность запрещённых ответов после атаки снизилась с 43,83 без защиты до 30,23 с GSU. В сравнениях на TOFU метод занял первое или второе место в 17 из 18 случаев. Проверка на обычном дообучении по экономике также показала, что модели сохраняют способность учиться разрешённым задачам.
Границы результата задаёт сам эксперимент: защита испытана на двух наборах задач, нескольких моделях и конечных бюджетах контролируемого дообучения. Часть дополнительных траекторий построена по одному запуску. Работа показывает сопротивление проверенным атакам, а не невозможность восстановить навык при полном доступе к весам.
Команде, которая выпускает параметры модели, придётся добавить перед публикацией три элемента: приблизительную выборку запрещённой области, набор разрешённых данных для сохранения качества и испытания с независимым дообучением. Оценивать только ответы до релиза уже недостаточно — тест должен измерять, что модель освоит после него.
Для продукта, который предоставляет модель только через API, GSU не заменяет контроль запросов, доступов и результатов. Метод рассчитан прежде всего на сценарий, где пользователь получает веса и может менять их без ограничений. Его практическая роль — повысить стоимость приобретения конкретного навыка, не лишая модель общей способности к адаптации.
Источники
Иллюстрация: рисунок из статьи «Preemptive LLM Unlearning against Forbidden Capability Acquisition via Gradient Sealing», Kemou Li, Qizhou Wang, Yue Wang и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



