Журнал · Rit.work

Безопасный ответ не делает ИИ-агента безопасным

Защиту ИИ-агента предлагают проверять на всём пути исполнения: от запроса и плана до памяти, инструментов и общения с другими агентами.

Rit.work
Студия разработки
14 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Фильтр финального ответа не защищает агентную ИИ-систему целиком: атака может изменить план, память или вызов инструмента раньше, чем модель сформулирует ответ. Хотя препринт Md Jueal Mia, Yanzhao Wu, Selcuk Uluagac и M. Hadi Amini не рецензирован и приведённые числа получили сами авторы, его главный вывод меняет критерий безопасности: проверять нужно весь процесс исполнения. Для продукта это означает, что модерации текста на входе и выходе недостаточно.

Авторы разложили обход защитных ограничений (jailbreak) и способы защиты по пяти слоям: взаимодействие с пользователем, планирование и рассуждение, память, работа с инструментами и связь между агентами. Они также разделили три свойства, которые часто смешивают: реакцию модели на явно вредный запрос, устойчивость к специально подготовленной атаке и безопасность действий агента.

Сильная встроенная настройка безопасности не гарантирует устойчивость к атаке. Защита зависит от модели, способа атаки и слоя, на котором её применяют. Она также может чаще блокировать допустимые запросы, ухудшать полезность системы и увеличивать задержку.

Главная проблема проявляется между запросом и ответом. Агент может записать вредные данные в постоянную память, построить опасный план или вызвать внешний инструмент, а затем вернуть безобидный текст благодаря последнему фильтру. Поэтому журналировать и проверять стоит не только сообщения модели, но и состояние агента, переходы между этапами и внешние действия; для инструментов нужны отдельные права и проверки перед выполнением.

Работа сочетает систематизацию прежних подходов с контролируемым сравнением типичных атак и защит в общей агентной среде. Поскольку доступен только абстракт, из него нельзя восстановить модели, наборы заданий, масштаб проверки и конкретные результаты; выводы относятся к описанным слоям агентного процесса, а не к определённому стеку или продукту.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу