Журнал · Rit.work

Метод дообучения меняет механику отказов LLM

Авторы сравнили три способа безопасного дообучения LLM и выяснили, как они меняют внутренний механизм отказов и возможность его точечной коррекции.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Hoang Cuong Nguyen, Mark Dras и Usman Naseem сравнили, как безопасное дообучение формирует внутренний механизм отказов LLM, в препринте, который не проходил рецензирования. По их замерам, ни один вариант не совместил распределённый механизм отказа, сохранение общих возможностей и возможность точечной коррекции. Работа важна для команд, которые рассчитывают на дообучение как на основной защитный слой в системах с повышенными требованиями к безопасности.

Что сделали

Авторы полностью дообучили Llama-3.1-8B, Gemma-2-9B и Qwen3-8B тремя способами: обычным обучением на примерах, обучением с цепочками рассуждений о безопасности и ORPO — оптимизацией по предпочтительным и отклонённым ответам. Для обучения использовали безопасные и вредоносные запросы из Alpaca и BeaverTails.

Внутреннюю механику отказа исследовали через подмену активаций: в модель переносили промежуточные состояния от другого примера и измеряли, какие слои, блоки и механизмы внимания причинно влияют на ответ. Затем авторы пытались менять поведение небольшими вмешательствами в найденные компоненты.

Обучение с рассуждениями во всех архитектурах формировало отдельный, более распределённый путь отказа. ORPO чаще снижал долю успешных атак, но создавал другой компромисс: у Gemma-2-9B на StrongREJECT атаки не проходили, тогда как на XSTest модель ошибочно отклоняла 31,6% безопасных запросов. Надёжность точечной коррекции зависела не только от способа обучения, но и от архитектуры.

Что это значит

Безопасное дообучение нельзя считать взаимозаменяемой настройкой: одинаковые данные и разная цель обучения создают разные внутренние механизмы. Для продукта это означает, что проверять нужно не только долю отказов, но и ложные отказы, устойчивость к атакам и последствия вмешательств для остальных возможностей модели.

Ограничения. Авторы проверили по одной модели каждой архитектуры только в масштабе 8–9 млрд параметров; причинный анализ опирался на 256 пар запросов, а поведение оценивалось на WildJailbreak, StrongREJECT, XSTest и части MMLU. Условия обучения ORPO отличались по устройству данных, поскольку ему требовались пары ответов. В сравнении нет метода, одновременно использующего рассуждения и предпочтения, онлайн-оптимизации и моделей большего масштаба. Авторы также зафиксировали нестабильность пограничных классификаций между повторными запусками.

Источники

Иллюстрация: рисунок из статьи «Beyond Shallow Alignment: How Post-Training Methods Determine Refusal Circuits And Steering Robustness», Hoang Cuong Nguyen, Mark Dras, Usman Naseem, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу