Журнал · Rit.work

SafeToken удерживает защитный отказ одним вектором

SafeToken снижает долю успешных атак на R1-8B с 37,3% до 2,2%, меняя только один вектор и не затрагивая веса модели.

Rit.work
Студия разработки
17 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Защитный отказ у моделей с пошаговым рассуждением может сорваться в момент, когда модель генерирует первый токен, хотя до этого распознаёт вредоносный запрос. В препринте команды из Harbin Institute of Technology, Guangzhou University и City University of Macau, который не прошёл рецензирование и содержит замеры самих авторов, SafeToken снизил долю успешных атак на R1-8B с 37,3% до 2,2%. Это даёт дополнительный слой защиты без изменения весов модели, но не универсальную защиту от атак на обход ограничений.

Команда сравнила скрытые состояния моделей семейства R1 с родственными моделями, настроенными выполнять инструкции. Во время обработки запроса их сигналы отказа оставались похожими, но на первом сгенерированном токене у R1 резко расходились. Ответы часто начинались с утвердительных слов вроде Okay и Alright, даже если позднее модель всё же отказывала.

Принудительный безопасный префикс и прямое усиление внутреннего направления отказа в этой позиции уменьшали долю успешных атак. Значит, первый токен не просто совпадает по времени со сбоем: состояние модели в начале генерации влияет на дальнейший ответ.

SafeToken помещает в эту позицию обученный непрерывный вектор. При обучении базовую модель замораживают и меняют только представление специального токена — для R1-8B это 4096 параметров. Во время генерации его добавляют в конец входной последовательности, чтобы последующее рассуждение начиналось с усиленным сигналом отказа.

Метод проверяли на R1-8B, R1-7B и Qwen3-8B: оценивали вредоносные запросы, атаки на обход ограничений, ошибочные отказы и задачи на рассуждение. На MATH результат R1-8B сохранился на уровне 75,2%, однако против некоторых усиленных атак SafeToken помогал слабее. Метод нацелен на случаи, когда модель уже распознала риск, но теряет сигнал отказа при переходе к генерации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу