Журнал · Rit.work

Безопасный навык не гарантирует безопасную цепочку ИИ-агента

Вредоносную цель можно распределить между несколькими навыками ИИ-агента так, чтобы каждый прошёл проверку, а опасное поведение возникло только при их совместной работе.

Rit.work
Студия разработки
28 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Вредоносное поведение ИИ-агента можно спрятать в цепочке внешне безопасных навыков, которые по отдельности не вызывают подозрений. В препринте Zihao Zhu, Siwei Lyu, Adel Bibi и Baoyuan Wu такие атаки срабатывали в среднем в 89,4% тестов, хотя работа пока не рецензирована, а числа получили сами авторы. Для команд, которые подключают к агенту сторонние пакеты, проверка каждого пакета отдельно больше не выглядит достаточной границей защиты.

Как безобидные изменения складываются во вред

Навык в такой системе — пакет инструкций, исполняемых сценариев и справочных материалов для конкретной задачи. Агент загружает нужные навыки во время работы, а их результаты записывает в общий контекст: следующий навык получает не только запрос пользователя, но и вывод предыдущих этапов.

Атака использует этот общий контекст как канал передачи. Злоумышленник контролирует как минимум два установленных навыка и распределяет между ними одну цель. Каждое изменение имеет правдоподобное объяснение и проходит отдельную проверку, но совместное выполнение меняет ответ агента или заставляет его совершить лишнее действие.

В примере с проверкой лекарств первый навык ослабляет сигнал о недавно отменённом препарате. Второй снижает серьёзность связанного с ним взаимодействия, третий убирает предупреждение с низким приоритетом из итоговой сводки. Ни один шаг сам по себе не скрывает опасность полностью, но врач получает результат без критического предупреждения.

Авторы выделяют причинные, составные и гибридные цепочки. В причинной атаке каждый этап ослабляет унаследованный сигнал. В составной отдельные фрагменты остаются безвредными, пока не попадут в один итоговый ответ. Гибридная атака совмещает последовательную передачу данных и независимые фрагменты.

Как проверяли цепочки навыков

Для генерации атак собрали SkillCascade — систему из нескольких агентов. Она подбирает реалистичную задачу, находит подходящие навыки из ClawHub, распределяет между ними вредоносную цель, проверяет каждый пакет отдельно и запускает всю цепочку в изолированной среде. Модель-оценщик затем сравнивает результат и журнал выполнения с критериями конкретного теста.

Так появился SkillCascade-Bench: 213 проверенных сценариев из десяти областей, построенных на реальных навыках ClawHub. В средней цепочке участвовало чуть больше трёх навыков. Сценарии охватывали искажение ответа, манипуляцию решением, ухудшение качества, выход за заданную область, утечку информации и действия без разрешения.

Атаки запускали на OpenClaw, Claude Code и Codex с восемью языковыми моделями. Для сравнения использовали проверки отдельных пакетов, совместный анализ набора навыков и защиту во время выполнения, которая наблюдает за вызовами инструментов, промежуточными данными и итоговым ответом.

Средняя доля успешных атак составила 89,4%. В зависимости от модели результат менялся от 76,5% до 97,1%, поэтому проблема не сводится к одному агенту или одному семейству моделей. Средняя доля обхода защит во время выполнения достигла 88,5%: такие средства искали привычные нарушения правил и опасные вызовы, тогда как каскад менял смысл данных в пределах разрешённых возможностей.

Когда в цепочке из трёх навыков возвращали к исходному состоянию хотя бы одно изменение, остаточная доля успешных атак падала до 13–18%. Значит, вред действительно возникал из сочетания шагов, а не скрывался целиком в одном пакете.

Проверка проходила в реалистичных изолированных средах, а не в рабочих установках. Поэтому результаты показывают, насколько уязвимой может быть архитектура в стресс-тесте, но не оценивают частоту таких атак в открытых каталогах.

Что менять в защите агентной системы

Единицей проверки должна стать цепочка поведения, а не каталог одного навыка. Сканер исходного кода всё ещё нужен, но он не видит, как метка, приоритет или отфильтрованный фрагмент повлияют на следующие этапы. Перед установкой набора стоит строить общий граф: какие данные пишет каждый навык, кто их читает и какое решение возникает на выходе.

Авторы проверили прототип такого анализа. Он сначала формулирует обязательства каждого навыка в виде «при каком условии выполняется какое действие», затем соединяет их и придумывает сценарий, который запускает всю последовательность. На причинных атаках подход снизил скрытность более чем на 30 процентных пунктов, но слабее справился с составными и гибридными цепочками.

В архитектуре продукта это означает, что доверие к поставщику нельзя назначать отдельно каждому пакету и затем автоматически переносить на их комбинацию. Нужны контроль состава установленных навыков, повторная проверка после обновлений, испытания типовых цепочек целиком и наблюдение за тем, как промежуточные классификации меняют итоговое действие.

Особого внимания требуют комплекты навыков от одного поставщика: рассматриваемая модель угроз предполагает, что злоумышленник контролирует несколько совместно установленных пакетов. Запрет сторонних навыков решает эту задачу ценой расширяемости, а для открытой экосистемы практичнее ограничивать каналы передачи данных и проверять совместный эффект до допуска в рабочую среду.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу