Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Kuan-Lin Chu, Chung-En Sun и Tsui-Wei Weng описали внутреннюю организацию отказов LLM и способ усилить её без дообучения; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, средняя доля безопасных ответов при атаке выросла с 43,2 до 69,7%. Результат важен командам, которые разворачивают модели с доступом к весам и хотят дополнить обучение точечной модификацией внутренних компонентов.
Что сделали
Авторы представляют отказ как последовательную работу трёх типов компонентов трансформера. Головки обнаружения вредоносного содержания реагируют на опасные элементы запроса. Нейроны безопасности передают и стабилизируют этот сигнал в остаточном потоке — общем состоянии, которое последовательно изменяют слои модели. Головки отказа преобразуют накопленный сигнал в ответ, где модель отклоняет запрос.
Компоненты искали на парах запросов, различавшихся словом, которое меняло смысл с нейтрального на вредоносный. Для головок обнаружения измеряли, насколько сильнее внимание направлялось на изменённое слово. Для остальных компонентов строили направление отказа: разницу между внутренними представлениями ответов на вредоносный и нейтральный запросы. Головки внимания и нейроны, чьи записи в остаточный поток совпадали с этим направлением, относили к цепочке безопасности.
Чтобы проверить не только корреляцию, авторы отключали выбранные компоненты и наблюдали, как меняется вклад последующих головок отказа. Прицельное отключение сравнивали со случайным удалением такого же количества компонентов. В работе утверждается, что удаление головок обнаружения ослабляло последующий отказ, а отключение нейронов безопасности давало ещё более выраженный эффект. Это согласуется с предложенной последовательностью «обнаружение — передача сигнала — отказ».
Затем авторы увеличили вклад найденных компонентов, масштабируя выходные проекции головок внимания и нисходящие проекции отдельных нейронов. Архитектура и набор слоёв при этом не менялись, дополнительное обучение не проводилось. Изменённые веса загружаются как обычная модель, поэтому вмешательство не добавляет отдельного этапа обработки запроса во время генерации.
Что показали
Эксперименты охватили шесть моделей: семейства LLaMA, Mistral, Guanaco и Qwen. Безопасность проверяли на вредоносных запросах AdvBench, включая GCG и адаптивные атаки, а ответы в основном классифицировал Llama-Guard. Дополнительные проверки с Claude и человеческими оценщиками, по утверждению авторов, подтвердили направление изменения.
Усиление каждого типа компонентов по отдельности повышало долю ответов, признанных безопасными, но совместное масштабирование давало больший прирост. Это поддерживает основную гипотезу работы: отказ связан не с одним изолированным участком модели, а с взаимодействием компонентов на разных слоях.
Побочный эффект измеряли по точности на четырёх стандартных задачах. Среднее снижение составило 1,7 процентного пункта, хотя результаты зависели от конкретной модели и задачи. Авторы также проверяли ложные отказы на нейтральных запросах: вмешательство не сводилось к одинаковому запрету всех ответов, но на части архитектур число лишних отказов увеличивалось.
Ограничения
Работа проверяет модели с открытыми весами размером от 4 до 8 миллиардов параметров. Она не показывает, сохраняется ли найденная организация у более крупных систем, моделей другой архитектуры или сервисов, доступных только через API. Метод требует изменять внутренние проекции, поэтому его нельзя непосредственно перенести на закрытую модель.
Компоненты определяются по статическому снимку внутренних представлений. Сами авторы отмечают, что не исследовали, сохранятся ли они после продолжительного обучения или последующей настройки модели. Для продукта это существенно: обновление весов может потребовать повторного поиска цепочки и новой проверки безопасности.
Основные испытания построены на AdvBench и нескольких способах обхода ограничений, а не на трафике производственных систем с их предметной областью, языками и правилами допустимого ответа. Автоматическая оценка преимущественно опирается на Llama-Guard; человеческая проверка проведена на ограниченной части ответов. Сравнения с CircuitBreakers и другими защитами охватывают только отдельные архитектуры и условия, а не весь набор моделей. В работе также не приведены затраты на поиск компонентов и повторную оценку после обновлений.
Что это значит
Работа не меняет базовый план команд, которые используют внешний API: фильтрация входов и выходов, системные инструкции, разграничение доступа и журналирование остаются доступными средствами, а вмешательство в веса для таких систем невозможно.
Для команд с собственным развёртыванием результат добавляет кандидат на отдельный слой защиты. Масштабирование можно применять после обучения, не создавая новый модуль во время выполнения. Однако это не готовая универсальная настройка: компоненты зависят от модели, а коэффициенты усиления приходится выбирать с учётом качества ответов и ложных отказов.
Практический план может измениться на этапе оценки модели. Помимо поведенческих испытаний стоит проверить, удаётся ли воспроизвести найденную цепочку на собственных запросах, затем сравнить исходные и изменённые веса на атаках, рабочих задачах и допустимых пограничных сценариях. Рассматривать такое редактирование как замену внешним ограничениям оснований пока нет: авторы показали локальное усиление отказов в экспериментальных условиях, но не долговременную устойчивость всей системы безопасности.
Источники
Иллюстрация: рисунок из статьи «From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling», Kuan-Lin Chu, Chung-En Sun, Tsui-Wei Weng, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



