Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Вредоносное поведение ИИ-агента можно спрятать в цепочке внешне безопасных навыков, которые по отдельности не вызывают подозрений. В препринте Zihao Zhu, Siwei Lyu, Adel Bibi и Baoyuan Wu такие атаки срабатывали в среднем в 89,4% тестов, хотя работа пока не рецензирована, а числа получили сами авторы. Для команд, которые подключают к агенту сторонние пакеты, проверка каждого пакета отдельно больше не выглядит достаточной границей защиты.
Как безобидные изменения складываются во вред
Навык в такой системе — пакет инструкций, исполняемых сценариев и справочных материалов для конкретной задачи. Агент загружает нужные навыки во время работы, а их результаты записывает в общий контекст: следующий навык получает не только запрос пользователя, но и вывод предыдущих этапов.
Атака использует этот общий контекст как канал передачи. Злоумышленник контролирует как минимум два установленных навыка и распределяет между ними одну цель. Каждое изменение имеет правдоподобное объяснение и проходит отдельную проверку, но совместное выполнение меняет ответ агента или заставляет его совершить лишнее действие.
В примере с проверкой лекарств первый навык ослабляет сигнал о недавно отменённом препарате. Второй снижает серьёзность связанного с ним взаимодействия, третий убирает предупреждение с низким приоритетом из итоговой сводки. Ни один шаг сам по себе не скрывает опасность полностью, но врач получает результат без критического предупреждения.
Авторы выделяют причинные, составные и гибридные цепочки. В причинной атаке каждый этап ослабляет унаследованный сигнал. В составной отдельные фрагменты остаются безвредными, пока не попадут в один итоговый ответ. Гибридная атака совмещает последовательную передачу данных и независимые фрагменты.
Как проверяли цепочки навыков
Для генерации атак собрали SkillCascade — систему из нескольких агентов. Она подбирает реалистичную задачу, находит подходящие навыки из ClawHub, распределяет между ними вредоносную цель, проверяет каждый пакет отдельно и запускает всю цепочку в изолированной среде. Модель-оценщик затем сравнивает результат и журнал выполнения с критериями конкретного теста.
Так появился SkillCascade-Bench: 213 проверенных сценариев из десяти областей, построенных на реальных навыках ClawHub. В средней цепочке участвовало чуть больше трёх навыков. Сценарии охватывали искажение ответа, манипуляцию решением, ухудшение качества, выход за заданную область, утечку информации и действия без разрешения.
Атаки запускали на OpenClaw, Claude Code и Codex с восемью языковыми моделями. Для сравнения использовали проверки отдельных пакетов, совместный анализ набора навыков и защиту во время выполнения, которая наблюдает за вызовами инструментов, промежуточными данными и итоговым ответом.
Средняя доля успешных атак составила 89,4%. В зависимости от модели результат менялся от 76,5% до 97,1%, поэтому проблема не сводится к одному агенту или одному семейству моделей. Средняя доля обхода защит во время выполнения достигла 88,5%: такие средства искали привычные нарушения правил и опасные вызовы, тогда как каскад менял смысл данных в пределах разрешённых возможностей.
Когда в цепочке из трёх навыков возвращали к исходному состоянию хотя бы одно изменение, остаточная доля успешных атак падала до 13–18%. Значит, вред действительно возникал из сочетания шагов, а не скрывался целиком в одном пакете.
Проверка проходила в реалистичных изолированных средах, а не в рабочих установках. Поэтому результаты показывают, насколько уязвимой может быть архитектура в стресс-тесте, но не оценивают частоту таких атак в открытых каталогах.
Что менять в защите агентной системы
Единицей проверки должна стать цепочка поведения, а не каталог одного навыка. Сканер исходного кода всё ещё нужен, но он не видит, как метка, приоритет или отфильтрованный фрагмент повлияют на следующие этапы. Перед установкой набора стоит строить общий граф: какие данные пишет каждый навык, кто их читает и какое решение возникает на выходе.
Авторы проверили прототип такого анализа. Он сначала формулирует обязательства каждого навыка в виде «при каком условии выполняется какое действие», затем соединяет их и придумывает сценарий, который запускает всю последовательность. На причинных атаках подход снизил скрытность более чем на 30 процентных пунктов, но слабее справился с составными и гибридными цепочками.
В архитектуре продукта это означает, что доверие к поставщику нельзя назначать отдельно каждому пакету и затем автоматически переносить на их комбинацию. Нужны контроль состава установленных навыков, повторная проверка после обновлений, испытания типовых цепочек целиком и наблюдение за тем, как промежуточные классификации меняют итоговое действие.
Особого внимания требуют комплекты навыков от одного поставщика: рассматриваемая модель угроз предполагает, что злоумышленник контролирует несколько совместно установленных пакетов. Запрет сторонних навыков решает эту задачу ценой расширяемости, а для открытой экосистемы практичнее ограничивать каналы передачи данных и проверять совместный эффект до допуска в рабочую среду.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



