Журнал · Rit.work

TRACE учит LLM сохранять отказ в длинном диалоге

TRACE использует одношаговые примеры для защиты LLM от атак, которые раскрывают вредную цель постепенно, и почти вдвое снижает долю успешных атак.

Rit.work
Студия разработки
2 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Одношаговые примеры безопасных ответов научились переносить на диалоги, в которых вредную цель раскрывают постепенно. В работе Fengpeng Li и коллег, которая не прошла рецензирование и опирается на их собственные замеры, TRACE снизил среднюю долю успешных многоходовых атак с 52,81% до 28,98%. Это позволяет обучать защиту на более простых парах «вредный запрос — безопасный ответ», но проверять её всё равно нужно в диалогах.

Авторы сначала описали условия, при которых такое обучение ограничивает риск на всей истории. Учебные запросы должны покрывать встречающиеся вредные намерения, подавление опасных продолжений должно перевешивать различия между учебным запросом и реальным контекстом, а непокрытые участки не должны возвращать риск. Поэтому теоретическая граница условна: она связывает одношаговое обучение с многоходовым риском, но сама по себе не доказывает, что новая модель безопаснее исходной при любой атаке.

TRACE распределяет обучение по отдельным токенам. В безопасном ответе он сравнивает исходную модель с её копией, из которой удалили усвоенный шаблон отказа, и переносит поздние признаки отказа на ранние слова ответа. В отклонённом ответе метод выбирает позиции с наибольшим риском и подавляет не только фактический токен, но и вероятные альтернативы модели. Штраф за величину градиента сдерживает изменение модели без отдельного набора безвредных примеров.

Метод проверили на пяти моделях с открытыми весами и семи многоходовых атаках, сравнив с SFT, DPO, X-Boundary, DOOR и W-DOOR. TRACE показал наименьшую долю успешных атак в каждой комбинации модели и атаки. Точность на MMLU и HellaSwag снизилась не более чем на 1,23 пункта, однако трудной осталась X-Teaming: даже после обучения она чаще других обходила защиту.

Источники

Иллюстрация: рисунок из статьи «TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety», Fengpeng Li, Kemou Li, Qizhou Wang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу