Журнал · Rit.work

Как закрыть LLM путь к последующему обучению запрещённым навыкам

GSU перед выпуском открытой LLM находит каналы, через которые модель может освоить запрещённый навык, и ослабляет градиенты в этих каналах.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Открытую LLM научились заранее делать менее восприимчивой к дообучению на запрещённой области, а не только скрывать уже выученные ответы. В препринте, который не проходил рецензирование и где числа получили сами авторы, метод GSU снизил точность запрещённых ответов на WMDP Bio с 65,36 до 34,13. Для поставщика открытых весов это новый этап подготовки модели перед выпуском: защищать нужно не только её ответы, но и пути будущего обучения.

Почему подавить ответы недостаточно

Обычное забывание работает с уже известным поведением. Метод получает примеры, которые модель должна забыть, снижает вероятность нежелательных ответов и одновременно старается сохранить качество на обычных задачах.

Такая модель может перестать выдавать запрещённые сведения, но остаться готовой быстро освоить их снова. Дообучение меняет параметры через градиенты — сигналы, которые показывают, в какую сторону сдвигать веса. Если чувствительные к запрещённой области внутренние каналы продолжают проводить эти сигналы, новых данных достаточно, чтобы вернуть навык.

На TOFU это видно у NPO: показатель извлечения целевых фактов вырос после атаки с 0,112 до 0,326. Низкий результат при выпуске поэтому не говорит, насколько легко модель обучится после передачи весов пользователю.

Работа формулирует другую задачу — упреждающее забывание (preemptive unlearning). Защитник до выпуска знает запрещённую область и располагает её приблизительной выборкой, но не знает будущих данных, режима обучения и оптимизатора пользователя. Модель должна сопротивляться такому дообучению и при этом сохранять полезность на обычных задачах.

Как GSU перекрывает градиент

GSU сначала создаёт временную копию исходной модели и дообучает её на приблизительной выборке запрещённой области. Это пробное обучение не входит в итоговую модель: оно показывает, какие каналы в слоях многослойного перцептрона сильнее всего реагируют на приобретение нового навыка.

Метод сравнивает внутренние значения до и после пробного обучения и выбирает каналы с заметным ростом предактиваций — сигналов перед функцией активации. Выбранные каналы совпадали с теми, которые позднее сильнее менялись при независимой атаке. Когда исследователи полностью ослабили градиент только в верхней десятой части найденных каналов, прирост запрещённой способности сократился на 24,35%.

После поиска GSU отбрасывает временную копию и снова начинает с исходных весов. При итоговом обучении метод сдвигает предактивации выбранных каналов в отрицательную область. Там функция активации SiLU имеет почти нулевую производную, поэтому через канал проходит слабый градиент и последующему дообучению труднее его использовать.

Одновременно GSU подавляет запрещённые ответы и обучается на разрешённых данных. Первый компонент закрывает внутренний путь, второй улучшает состояние модели при выпуске, третий не даёт защите разрушить обычные возможности. Прямо штрафовать все градиенты не требуется: метод использует обычные производные первого порядка.

Для открытых весов появляется дополнительный рубеж, но не гарантия

GSU проверили на TOFU и WMDP Bio/Cyber с моделями семейств Llama-3.2 и Qwen3.5. Приблизительные данные защитника и данные атаки не пересекались, а среди соперников были NPO, RMU, GradDiff и другие методы ретроспективного забывания.

На WMDP Cyber точность запрещённых ответов после атаки снизилась с 43,83 без защиты до 30,23 с GSU. В сравнениях на TOFU метод занял первое или второе место в 17 из 18 случаев. Проверка на обычном дообучении по экономике также показала, что модели сохраняют способность учиться разрешённым задачам.

Границы результата задаёт сам эксперимент: защита испытана на двух наборах задач, нескольких моделях и конечных бюджетах контролируемого дообучения. Часть дополнительных траекторий построена по одному запуску. Работа показывает сопротивление проверенным атакам, а не невозможность восстановить навык при полном доступе к весам.

Команде, которая выпускает параметры модели, придётся добавить перед публикацией три элемента: приблизительную выборку запрещённой области, набор разрешённых данных для сохранения качества и испытания с независимым дообучением. Оценивать только ответы до релиза уже недостаточно — тест должен измерять, что модель освоит после него.

Для продукта, который предоставляет модель только через API, GSU не заменяет контроль запросов, доступов и результатов. Метод рассчитан прежде всего на сценарий, где пользователь получает веса и может менять их без ограничений. Его практическая роль — повысить стоимость приобретения конкретного навыка, не лишая модель общей способности к адаптации.

Источники

Иллюстрация: рисунок из статьи «Preemptive LLM Unlearning against Forbidden Capability Acquisition via Gradient Sealing», Kemou Li, Qizhou Wang, Yue Wang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу