Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Защитный отказ у моделей с пошаговым рассуждением может сорваться в момент, когда модель генерирует первый токен, хотя до этого распознаёт вредоносный запрос. В препринте команды из Harbin Institute of Technology, Guangzhou University и City University of Macau, который не прошёл рецензирование и содержит замеры самих авторов, SafeToken снизил долю успешных атак на R1-8B с 37,3% до 2,2%. Это даёт дополнительный слой защиты без изменения весов модели, но не универсальную защиту от атак на обход ограничений.
Команда сравнила скрытые состояния моделей семейства R1 с родственными моделями, настроенными выполнять инструкции. Во время обработки запроса их сигналы отказа оставались похожими, но на первом сгенерированном токене у R1 резко расходились. Ответы часто начинались с утвердительных слов вроде Okay и Alright, даже если позднее модель всё же отказывала.
Принудительный безопасный префикс и прямое усиление внутреннего направления отказа в этой позиции уменьшали долю успешных атак. Значит, первый токен не просто совпадает по времени со сбоем: состояние модели в начале генерации влияет на дальнейший ответ.
SafeToken помещает в эту позицию обученный непрерывный вектор. При обучении базовую модель замораживают и меняют только представление специального токена — для R1-8B это 4096 параметров. Во время генерации его добавляют в конец входной последовательности, чтобы последующее рассуждение начиналось с усиленным сигналом отказа.
Метод проверяли на R1-8B, R1-7B и Qwen3-8B: оценивали вредоносные запросы, атаки на обход ограничений, ошибочные отказы и задачи на рассуждение. На MATH результат R1-8B сохранился на уровне 75,2%, однако против некоторых усиленных атак SafeToken помогал слабее. Метод нацелен на случаи, когда модель уже распознала риск, но теряет сигнал отказа при переходе к генерации.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



