Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Многошаговые атаки на ИИ-агентов научились генерировать и проверять автоматически, имея лишь описание системы и доступ к её публичному интерфейсу. В препринте Divyanshu Kumar и соавторов, который не прошёл рецензирование и содержит их собственные замеры, максимальный балл риска поведения агента достиг 85%. Такой подход позволяет включить проверку архитектуры и прав инструментов в приёмку системы, даже если команда не может анализировать внутренний код.
SAGE-RT проводит проверку по принципу чёрного ящика (black-box). Система делит риски на семь областей: управление целями, качество ответов, использование инструментов, приватность, надёжность и наблюдаемость действий, поведение агента и контроль доступа. Для каждой области она создаёт 120 сценариев, включая многошаговые диалоги, запускает их через внешний интерфейс агента и собирает всю цепочку действий.
Ответы оценивает GPT-4o по набору бинарных критериев: например, раскрыл ли агент персональные данные или выполнил ли опасную операцию. Люди затем перепроверяют выводы с высоким баллом. Проценты в работе обозначают агрегированный балл сработавших критериев риска, а не вероятность успешного взлома конкретной системы.
Средний риск неверного управления целями составил 56,25% в обеих архитектурах. У многоагентного помощника для биржевых рекомендаций риск приватности достиг 65%, а риск манипулируемого поведения в одной конфигурации — 85%. Распределение слабых мест сильнее зависело от устройства агента и связей между инструментами, чем от выбранной базовой модели.
Метод проверили на однопользовательском агенте CrewAI для бронирования столиков и многоагентном помощнике AutoGen с четырьмя базовыми моделями: GPT-4.1-nano, Mistral Small, Gemini-2.5-Flash и Kimi K2 Instruct. Сценарии были преимущественно англоязычными; испытания искали уязвимости, но не проверяли, устраняют ли их фильтрация входных данных, ограничение прав и другие защитные меры.
Источники
Иллюстрация: рисунок из статьи «Black-Box Red Teaming of Agentic AI: A Taxonomy-Driven Framework for Automated Risk Discovery», Divyanshu Kumar, Nitin Aravind Birur, Tanay Baswa и др., CC BY-SA 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



