Журнал · Rit.work

Безопасное дообучение LLM: считать редкие провалы вместо среднего

Метод Johns Hopkins University ограничивает долю запросов, на которых дообученная LLM стала менее безопасной, и корректирует градиент только при угрозе выйти за этот предел.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

При дообучении LLM можно ограничивать не средний ущерб безопасности, а долю запросов, на которых модель заметно отклоняется от безопасной версии. В препринте Johns Hopkins University, который не рецензирован и содержит собственные замеры авторов, такой контроль удержал вредоносность почти неизменной даже при усилении отравления обучающих данных. Для команд, которые обучают свои модели, безопасность превращается из дополнительного штрафа в проверяемый бюджет отказов.

Среднее скрывает редкие, но тяжёлые провалы

Обычное безопасное дообучение сводит две цели в одну функцию: модель должна освоить новую задачу и сохранить безопасное поведение. Команда назначает второй цели вес или ограничивает среднюю потерю на наборе безопасных примеров.

Среднее не показывает, как распределились ошибки. Модель может почти не измениться на большинстве запросов, сильно ухудшиться на небольшой группе и всё равно уложиться в общий лимит. Для продукта эта группа может оказаться важнее среднего результата: например, именно в неё попадут запросы о причинении вреда.

Новый метод задаёт два отдельных параметра. Первый определяет, насколько может вырасти потеря на одном безопасном примере относительно исходной модели. Второй указывает допустимую долю примеров, которые могут перейти этот порог. Получается вероятностное ограничение (chance constraint): оно отвечает не на вопрос о среднем ухудшении, а на вопрос о частоте неприемлемых ухудшений.

Посчитать такую долю внутри градиентного обучения напрямую нельзя: отметка «порог превышен» меняется скачком. Поэтому её заменяют верхней оценкой, пригодной для вычисления градиента. Она сильнее выделяет примеры около порога и за ним, а выполненное ограничение для этой оценки гарантирует выполнение исходного ограничения на обучающем наборе.

Фильтр меняет градиент только у границы безопасности

Метод рассматривает допустимые параметры модели как безопасную область. На каждом шаге он проверяет, куда ведёт обычный градиент целевой задачи. Если обновление остаётся внутри области, обучение идёт без изменений; если оно ведёт наружу, к градиенту добавляется минимальная корректировка вдоль границы.

Для этой корректировки есть замкнутая формула. Не нужно подбирать вес штрафа или обучать отдельную двойственную переменную, как в других вариантах оптимизации с ограничениями. Но каждый шаг требует градиента по отдельному набору безопасных примеров, поэтому базовая реализация работает почти вдвое дольше обычного дообучения.

Проверка охватила Qwen-3.5-4B, Qwen-3.5-9B и Llama-3.1-8B-Instruct с адаптерами LoRA. Модели обучали на SST-2, AG News и GSM8K, подмешивая вредные пары из BeaverTails; безопасность оценивали на отдельной группе вредных запросов. Сравнение включало обычное дообучение и семь защит, среди них SafeGrad, SaLoRA, SafeLoRA и AsFT.

На Qwen-3.5-4B с SST-2 доля запросов с вредным ответом у нового метода почти не росла при усилении отравления. В наиболее жёстком режиме она составила 34% против 54,6% у обычного дообучения, а точность задачи — 95,7% против 97,3%. На SST-2 и AG News метод давал наименьшую вредоносность во всех проверенных режимах; на GSM8K конфликт между безопасностью и качеством оказался заметнее.

Планы меняются только у команд со своим контуром обучения

Работа предлагает менять не архитектуру модели, а критерий допуска обновлений. Если команда уже дообучает открытую модель и хранит отдельный набор критичных сценариев, метод можно встроить в цикл обучения как фильтр градиента. Порог ухудшения и допустимая доля нарушений при этом становятся явными требованиями продукта, а не следствием подобранного коэффициента.

Для дообучения через закрытый API подход напрямую не подходит: ему нужны градиенты целевой задачи и ограничения. Он также не снимает задачу составления набора безопасности. Ограничение действует на фиксированных примерах и измеряет вероятность заранее заданного безопасного ответа, а не фактический вред в свободных генерациях.

Гарантия сохранения безопасной области строго относится к точным значениям функции и градиента. При обучении на мини-пакетах возникает шум, поэтому реализация добавляет запас к ограничению, но абсолютной гарантии для каждого шага уже нет. Это делает метод дополнением к проверкам готовой модели, а не их заменой.

Практический вывод касается постановки требований: если недопустимы редкие тяжёлые регрессии, средняя потеря безопасности — слабая метрика. Тогда команде стоит заранее определить порог ухудшения, допустимую частоту превышений и набор сценариев, на котором эти параметры имеют продуктовый смысл.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу