Журнал · Rit.work

Представление отказа LLM переносится между архитектурами

Общее направление в активациях управляет отказом у трансформеров, моделей с пространством состояний, рекуррентных и гибридных моделей, но искать его нужно на выходе слоя.

Rit.work
Студия разработки
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Представление, которое заставляет LLM отказываться от вредного запроса, сохраняется при переходе от трансформера к другим архитектурам. В препринте, который не прошёл рецензирование и содержит замеры самих авторов, доля успешных атак на Falcon-Mamba упала с 98% до 5%. Значит, инструменты управления отказами можно переносить, но для каждой модели придётся заново находить подходящий выход слоя.

Preethi Carmel Bosco и Gopalakrishnan Srinivasan выделили направление отказа — вектор в активациях, который отличает вредные запросы от безопасных. Затем они совместили пространства активаций трансформера и Falcon-Mamba простым поворотом системы координат без растяжения. Перенесённое направление сохранило свою функцию: его удаление заставляло модель отвечать на запросы, которые она прежде отклоняла, а случайный вектор сопоставимой величины влиял заметно слабее.

Архитектуры различаются не самим представлением отказа, а местом, где его нужно измерять. Сигнал лучше всего читается на свежем выходе слоя до сложения с накопленным состоянием — в точке записи. Контроль с одинаковой силой вмешательства показал, что результат определяет место, где направление нашли, а не место, куда его затем добавили.

Направление подключили через классификатор, который проверяет запрос и усиливает отказ только при обнаружении вредного содержания. Метод сработал в четырёх классах архитектур: Falcon-Mamba, трансформерах Llama и Mistral, рекуррентной RWKV-6 и гибридной Zamba2. При этом он лишь сравнялся с простым правилом, которое возвращает заранее заданный отказ по сигналу того же классификатора: работа доказывает переносимость внутреннего представления, а не превосходство новой защиты.

Проверка охватила AdvBench, Alpaca и XSTest, несколько видов внедрения инструкций и атаку, которая подстраивала запрос под защиту. Основной режим генерировал 64 новых токена; при 256 ни одна испытанная сила вмешательства не сохранила одновременно связность ответа и защитный эффект. Поэтому перенос направления не отменяет настройки слоёв, силы воздействия и длины генерации на целевой модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу