Журнал · Rit.work

Бюджет атакующего стал параметром проверки ИИ-агентов

Косвенные инъекции инструкций чаще срабатывают, когда атакующий агент получает больше токенов на поиск и обратную связь от целевой системы.

Rit.work
Студия разработки
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Устойчивость ИИ-агента к скрытым командам меняется вместе с вычислительным бюджетом атакующего: дополнительные попытки открывают новые пути атаки. В препринте Dynamo AI и University of Illinois Urbana-Champaign, который не прошёл рецензирование и содержит замеры самих авторов, доля успешных атак на GPT-5.5 в Workspace достигла 52,1% при бюджете 100 тысяч токенов. Поэтому при проверке защиты нужно фиксировать не только модель и набор атак, но также способ поиска и доступный атакующему бюджет.

Работа рассматривает косвенную инъекцию инструкций (indirect prompt injection): злоумышленник прячет команду в письме, заметке или другом внешнем содержимом, которое агент читает через инструменты. Атакующий агент изучает среду, выбирает место и формулировку команды, запускает целевого агента и получает его ответ, последовательность действий и итог проверки.

Поиск организован вокруг списка стратегий и истории предыдущих попыток. Без инструментов разведки и управления стратегиями рост прекратился после 100 тысяч токенов: агент повторял похожие атаки и тратил бюджет на уже проверенные направления. Полная система продолжала находить варианты, особенно когда вредоносная команда находилась в документе, который целевой агент и так должен был прочитать для основной задачи.

Проверку провели на двух синтетических наборах задач: Workspace с почтой, календарём и рабочими заметками и Retail с операциями интернет-магазина. GLM-5.2 выступала атакующим, а GPT-5.5 и Claude Opus 4.8 — целевыми агентами; атакующий видел устройство среды. Устойчивость зависела от модели: в Retail Claude Opus 4.8 сохранила долю успешных атак на уровне 20,6% даже при бюджете 500 тысяч токенов.

Для архитектуры продукта вывод касается модели угроз. Разовая проверка на фиксированном наборе вредоносных строк может недооценить риск для агентов, которые читают внешние данные и вызывают инструменты. Нагрузочные испытания защиты стоит строить как адаптивный поиск: менять пользовательскую задачу, место инъекции и формулировку команды, а затем измерять, как доля успешных атак растёт вместе с бюджетом.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу