Журнал · Rit.work

Защита агента может сработать уже после опасного действия

Сравнение шести защитных модулей показало, как этап проверки влияет на задержку, устойчивость к атакам и выполнение безопасных задач.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Защитные модули для агентов, которые воспринимают обстановку и действуют в ней, срабатывают тем позже, чем дальше их ставят по цепочке от команды к действию. Работа HKUST и Renmin University сравнила шесть таких модулей; препринт не рецензирован, а числа получили сами авторы. Простые правила почти не добавили задержки, тогда как проверка каждого действия через LLM заняла 22,81 секунды на эпизод.

Для сравнения собрали единую среду с неизменным агентом и подключали к нему разные защитные модули. Проверка на этапе восприятия анализировала инструкцию до построения плана, на этапе планирования — уже готовую последовательность действий, а на этапе управления — каждое отдельное действие перед выполнением.

Ранняя проверка останавливала атаку быстрее. У Llama Guard задержка до блокировки на этапе восприятия составляла 0,02–0,06 времени незащищённого эпизода, а после построения плана — 0,30–0,88. Защита на этапе управления тоже запаздывала: к моменту блокировки агент уже успевал составить план и выполнить часть последовательности.

Цена зависит не только от места проверки, но и от способа принять решение. AgentSpec сопоставлял строки и состояние среды с правилами почти без вычислительных затрат. RoboSafe обращался к LLM перед каждым низкоуровневым действием и оказался самым медленным. Добавление изображения от первого лица к текстовым модулям последовательно ослабляло защиту: дополнительный канал не помог, а разбавил сигнал об опасности.

Ни один модуль не оказался лучшим одновременно по защите, задержке и работе с безопасными командами. Более строгие варианты чаще останавливали атаки, но также блокировали допустимые инструкции и снижали долю выполненных задач. Поэтому этап проверки нельзя выбирать отдельно от допустимого риска: если агент не должен начинать опасную последовательность, одной проверки на этапе управления недостаточно.

Испытания прошли в бытовом симуляторе AI2-THOR, а не на физических роботах: использовали по 300 безопасных и вредоносных инструкций, планировщики GPT-4o и DeepSeek-V3.2, шаблонные и автоматические атаки. Результаты показывают поведение защиты в этой конфигурации и не измеряют задержки реального оборудования.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу