Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Защитные модули для агентов, которые воспринимают обстановку и действуют в ней, срабатывают тем позже, чем дальше их ставят по цепочке от команды к действию. Работа HKUST и Renmin University сравнила шесть таких модулей; препринт не рецензирован, а числа получили сами авторы. Простые правила почти не добавили задержки, тогда как проверка каждого действия через LLM заняла 22,81 секунды на эпизод.
Для сравнения собрали единую среду с неизменным агентом и подключали к нему разные защитные модули. Проверка на этапе восприятия анализировала инструкцию до построения плана, на этапе планирования — уже готовую последовательность действий, а на этапе управления — каждое отдельное действие перед выполнением.
Ранняя проверка останавливала атаку быстрее. У Llama Guard задержка до блокировки на этапе восприятия составляла 0,02–0,06 времени незащищённого эпизода, а после построения плана — 0,30–0,88. Защита на этапе управления тоже запаздывала: к моменту блокировки агент уже успевал составить план и выполнить часть последовательности.
Цена зависит не только от места проверки, но и от способа принять решение. AgentSpec сопоставлял строки и состояние среды с правилами почти без вычислительных затрат. RoboSafe обращался к LLM перед каждым низкоуровневым действием и оказался самым медленным. Добавление изображения от первого лица к текстовым модулям последовательно ослабляло защиту: дополнительный канал не помог, а разбавил сигнал об опасности.
Ни один модуль не оказался лучшим одновременно по защите, задержке и работе с безопасными командами. Более строгие варианты чаще останавливали атаки, но также блокировали допустимые инструкции и снижали долю выполненных задач. Поэтому этап проверки нельзя выбирать отдельно от допустимого риска: если агент не должен начинать опасную последовательность, одной проверки на этапе управления недостаточно.
Испытания прошли в бытовом симуляторе AI2-THOR, а не на физических роботах: использовали по 300 безопасных и вредоносных инструкций, планировщики GPT-4o и DeepSeek-V3.2, шаблонные и автоматические атаки. Результаты показывают поведение защиты в этой конфигурации и не измеряют задержки реального оборудования.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



