Журнал · Rit.work

SAGE-RT проверяет ИИ-агентов атаками без доступа к коду

SAGE-RT генерирует многошаговые атаки через публичный интерфейс и показывает, как архитектура ИИ-агента влияет на утечки данных и опасные действия.

Rit.work
Студия разработки
10 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Многошаговые атаки на ИИ-агентов научились генерировать и проверять автоматически, имея лишь описание системы и доступ к её публичному интерфейсу. В препринте Divyanshu Kumar и соавторов, который не прошёл рецензирование и содержит их собственные замеры, максимальный балл риска поведения агента достиг 85%. Такой подход позволяет включить проверку архитектуры и прав инструментов в приёмку системы, даже если команда не может анализировать внутренний код.

SAGE-RT проводит проверку по принципу чёрного ящика (black-box). Система делит риски на семь областей: управление целями, качество ответов, использование инструментов, приватность, надёжность и наблюдаемость действий, поведение агента и контроль доступа. Для каждой области она создаёт 120 сценариев, включая многошаговые диалоги, запускает их через внешний интерфейс агента и собирает всю цепочку действий.

Ответы оценивает GPT-4o по набору бинарных критериев: например, раскрыл ли агент персональные данные или выполнил ли опасную операцию. Люди затем перепроверяют выводы с высоким баллом. Проценты в работе обозначают агрегированный балл сработавших критериев риска, а не вероятность успешного взлома конкретной системы.

Средний риск неверного управления целями составил 56,25% в обеих архитектурах. У многоагентного помощника для биржевых рекомендаций риск приватности достиг 65%, а риск манипулируемого поведения в одной конфигурации — 85%. Распределение слабых мест сильнее зависело от устройства агента и связей между инструментами, чем от выбранной базовой модели.

Метод проверили на однопользовательском агенте CrewAI для бронирования столиков и многоагентном помощнике AutoGen с четырьмя базовыми моделями: GPT-4.1-nano, Mistral Small, Gemini-2.5-Flash и Kimi K2 Instruct. Сценарии были преимущественно англоязычными; испытания искали уязвимости, но не проверяли, устраняют ли их фильтрация входных данных, ограничение прав и другие защитные меры.

Источники

Иллюстрация: рисунок из статьи «Black-Box Red Teaming of Agentic AI: A Taxonomy-Driven Framework for Automated Risk Discovery», Divyanshu Kumar, Nitin Aravind Birur, Tanay Baswa и др., CC BY-SA 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу