Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Опасную цель LLM-агента можно распознать по тому, как меняется его внутреннее состояние между шагами, даже если каждый отдельный шаг выглядит допустимым. На MT-AgentRisk защита снизила долю успешных атак с 84% до 25%. Работа Singapore Management University и National University of Singapore пока не прошла рецензирование, а все числа получили сами авторы; результат показывает, что многошаговую атаку можно ловить без второго LLM, но для этого нужен доступ к внутренним состояниям основной модели.
Как сдвиг между шагами выдаёт опасную цель
Обычный защитный фильтр проверяет входное сообщение, ответ или вызов инструмента по отдельности. Такой подход пропускает атаку, разбитую на разрешённые действия: агент сначала читает данные, затем преобразует их, а позже отправляет наружу или использует для платежа. Опасность возникает из последовательности, а не из одного явно вредного запроса.
DART следит за скрытым состоянием модели после каждого нового фрагмента контекста. Фрагментом может быть сообщение пользователя, результат инструмента, документ из поиска или запись из памяти. Монитор берёт состояние последнего токена на выбранном слое до и после добавления фрагмента и вычисляет разницу.
Для каждой модели заранее строят направление, которое отделяет переходы из вредных траекторий от переходов из безопасных. Затем каждый новый сдвиг проецируют на это направление и складывают оценки по всей траектории. Поэтому несколько слабых сигналов могут вместе пересечь порог, хотя ни один шаг сам по себе его не достигает.
Сумма раскладывается обратно на вклады отдельных фрагментов. Когда монитор срабатывает, DART выбирает контекст с наибольшим вкладом и добавляет адресное напоминание: например, просит считать инструкции из результата инструмента недоверенными данными. После этого агент заново формирует следующий ответ, сохраняя остальной контекст.
Почему простой накопительный счётчик не работает
Без дополнительной обработки безопасная работа агента тоже постепенно сдвигает внутреннее состояние. На него влияют позиция фрагмента в диалоге, переход от сообщения пользователя к ответу инструмента и выбор самого инструмента. Небольшие безопасные сдвиги на длинной траектории могут перекрыть короткую инъекцию.
DART убирает из контрольного направления средний сдвиг безопасных траекторий и главные направления их обычных колебаний. Эту очистку выполняют при настройке монитора, поэтому во время работы она не требует дополнительных вычислений. После неё нулевой уровень лучше соответствует нормальному трафику, а редкая вредная вставка остаётся заметной.
На ASEval, где вредная инструкция спрятана среди обычных шагов, доля успешных атак снизилась с 97% до 52%. На MT-AgentRisk монитор поймал все вредные траектории при средней доле ложных тревог 12%. При этом полезность на безопасных задачах снизилась на 8% в MT-AgentRisk и не изменилась в ASEval.
Очистка особенно повлияла на разреженные атаки: исходное направление часто принимало обычное начало траектории за главный источник риска. После удаления фонового сдвига монитор чаще связывал тревогу с внедрённой инструкцией. На MT-AgentRisk, где каждый шаг продвигает вредную цель, разница была меньше, поскольку сигнал там не нужно искать среди длинных безопасных участков.
Когда DART меняет архитектурный план
Метод проверяли онлайн без просмотра будущих шагов на шести локально запущенных моделях семейств Qwen3, Llama и Mistral. MT-AgentRisk моделирует вредную задачу, разложенную на допустимые действия, а ASEval добавляет инструкции в обычные траектории с инструментами. Направление безопасности обучали отдельно для каждой модели, поскольку слои и размер скрытых состояний различаются.
DART подходит командам, которые размещают модель сами и могут читать её внутренние состояния. Для закрытого API, возвращающего только текст и вызовы инструментов, такой монитор встроить нельзя. Замена модели или заметное изменение рабочего цикла также потребует заново подобрать слой, направление и порог на безопасных и вредных траекториях из нужного домена.
Монитор не держит в памяти дополнительную LLM и использует уже выполненный прямой проход основной модели. В экспериментальной реализации проверка добавляла 0,14–0,56 секунды на отслеживаемый шаг; авторы считают это верхней границей, поскольку интегрированная версия может повторно использовать уже вычисленные состояния.
Детектор и реакцию на тревогу стоит проектировать отдельно. Адресное напоминание сохраняет контекст и позволяет закончить безопасную часть задачи, но на некоторых небольших моделях оно усиливало атаку вместо подавления. Для операций с платежами, доступом к данным или внешними сообщениями разумнее после сигнала задержать подозрительный результат инструмента либо остановить действие, а не полагаться только на самокоррекцию модели.
DART не заменяет проверку прав доступа, аргументов вызова и результата операции. Он добавляет недостающий уровень: замечает, что последовательность разрешённых шагов складывается в опасное намерение. Такой уровень имеет смысл закладывать в архитектуру локальных агентов уже сейчас, если продукт выполняет длинные цепочки действий и получает недоверенный контекст из документов, памяти или инструментов.
Источники
Иллюстрация: рисунок из статьи «Representation Transitions Reveal Emerging Safety Risks in Multi-Turn LLM Agents», Haoyu Wang, Wei Zhao, Yedi Zhang и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



