Журнал · Rit.work

Как запретить тексту подделывать управляющие токены LLM

Безымянная токенизация отделяет управляющие идентификаторы от пользовательского текста и закрывает уязвимость чат-шаблонов без переобучения LLM.

Rit.work
Студия разработки
16 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Текст внутри пользовательского сообщения может превратиться в границу системной или инструментальной реплики: такую подделку допустили все 256 проверенных чат-токенизаторов открытых LLM. Работа Korea University и Hanwha Aerospace, которая не прошла рецензирование и приводит замеры самих авторов, подняла точность обработки текста со служебными разделителями с 8,5 до 59,9%. Для разработчиков это означает локальную правку слоя токенизации без переобучения модели, но не полную защиту от внедрения инструкций.

Чат-шаблон размечает роли и результаты инструментов зарезервированными идентификаторами. У каждого есть строковое представление, поэтому документ из поиска или сообщение пользователя может содержать ту же строку: токенизатор превратит её в настоящий служебный идентификатор, и модель увидит поддельную границу реплики.

Безымянная токенизация оставляет служебному токену идентификатор, но убирает строку, по которой кодировщик мог бы создать его из недоверенного текста. Сам шаблон записывает такие идентификаторы напрямую, а содержимое сообщений проходит через обычное разбиение на токены без изменений. На запросах без атак новый способ воспроизвёл стандартную последовательность токенов.

Рекомендуемый флаг, который отключает разбор специальных токенов в сообщениях, оставил уязвимыми 56,6% токенизаторов. Он пропускает часть маркеров вызова инструментов и рассуждений, потому что репозитории не всегда помечают их как специальные. Фильтры, удаление и замена строк закрывают часть канала, но портят содержимое, если в задаче нужно скопировать, посчитать или отредактировать сами разделители.

Защиту проверяли на пяти моделях из разных семейств, трёх задачах с недоверенными данными и нескольких вариантах поддельных реплик. Сравнивали обычную токенизацию, удаление, маскирование и замену разделителей. Метод закрывает именно путь от текста к служебному идентификатору: обычная инструкция на естественном языке всё ещё может убедить модель нарушить системные правила, а системы, которые принимают готовые идентификаторы токенов, лежат за пределами этой защиты.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу