Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Внешняя защита LLM-агента научилась улучшаться на прошлых сбоях прямо во время эксплуатации, не меняя модель, которая выполняет задачи. В препринте East China Normal University, Huawei Noah’s Ark Lab и партнёров SafeCoEvo одновременно превзошёл сильнейший из сопоставимых методов по безопасности и успешности задач, хотя работу не рецензировали и все числа получили сами авторы. Для продукта это предлагает промежуточный путь между неизменными правилами и регулярным переобучением основной модели.
Опыт превращается сначала в правила, затем в параметры
SafeCoEvo оставляет рабочую LLM замороженной и обновляет два внешних компонента. S-Harness хранит явные инструкции и ограничения, а отдельная модель-контролёр решает, безопасно ли конкретное действие агента.
После каждой завершённой задачи система получает траекторию выполнения и обратную связь. Этот опыт может повлиять только на следующие задачи: SafeCoEvo не возвращается к будущим примерам и не прогоняет один набор заданий многократно. Такое условие отличает работу от методов, которые оптимизируют агента на заранее доступной выборке.
S-Harness обновляется после каждой задачи. Он распределяет полезный опыт между системной инструкцией по безопасности, проверенной памятью, навыками, политикой разрешений и правилами реакции на решения контролёра. Локальная ошибка при этом должна превратиться в обобщённое правило без названия набора испытаний, идентификатора задания и точного исходного примера.
Это быстрый слой адаптации: новое ограничение начинает действовать уже на последующих заданиях. Но явные правила со временем накапливаются, повторяются и могут конфликтовать, поэтому SafeCoEvo добавляет более медленный контур.
GuardVPO периодически обучает модель-контролёр на отдельных событиях из траекторий. Для каждого вызова сохраняются контекст, предполагаемое действие, решение «безопасно» или «опасно» и итоговая обратная связь. Ошибка, при которой опасное действие пропустили, наказывается сильнее лишней блокировки; отдельный штраф удерживает обновлённую модель рядом с исходной и ограничивает резкие изменения.
Два контура используют одну историю, но по-разному. S-Harness быстро записывает опыт в редактируемую форму, а GuardVPO постепенно превращает повторяющиеся закономерности в способность оценивать риск. Основную LLM при этом не переобучают и не развёртывают заново.
Небезопасных исходов стало меньше без потери полезности
Метод проверяли на Agent-SafetyBench и Agent Security Bench. Поток включал 1 024 последовательных эпизода; отдельная тестовая часть содержала сценарии, которых не было во время адаптации. В качестве рабочей модели использовали DeepSeek-v4.1-Flash, а начальным контролёром служил AgentDoG1.5-Unified-Qwen3.5-4B. Также авторы повторили часть сравнений с Qwen3.7-Flash и SingGuard.
В полном потоке доля эпизодов с небезопасным исходом составила 14,01% против 24,06% у SHE, сильнейшего метода сравнения с обновляемой защитной обвязкой. Одновременно доля успешно выполненных исходных задач достигла 76,08% против 63,93%. Значит, преимущество не свелось к более частым запретам: агент реже допускал опасный результат и чаще завершал задачу.
Разбор компонентов показывает разный вклад двух контуров. Одно обновление S-Harness дало основную прибавку относительно полностью статичной конфигурации, а обучение контролёра дополнительно улучшило результат после накопления событий. Отдельные проверки на R-Judge и ATBench также показали, что контролёр стал лучше замечать опасные события за пределами исходного потока, но немного хуже распознавал безопасные.
Что менять в архитектуре агентного продукта
Работа меняет планы команд, которые собирались закрепить защиту один раз перед запуском. SafeCoEvo показывает более гибкую схему: вынести безопасность из основной модели, обновлять явные правила после отдельных задач, а модель оценки риска обучать реже на накопленной истории.
Для такой схемы недостаточно хранить только финальный ответ агента. Система должна записывать контекст каждого проверяемого действия, решение контролёра и последующий результат. Нужна и достоверная обратная связь после завершения задачи: без неё невозможно понять, какое разрешение оказалось опасным, а какая блокировка была лишней.
Метод особенно уместен там, где основную модель дорого или рискованно регулярно менять, но защитный слой можно развивать отдельно. Быстрые исправления остаются читаемыми правилами, а устойчивые повторяющиеся случаи переходят в параметры меньшей специализированной модели.
Пока результат относится к последовательным потокам двух наборов испытаний и нескольким сочетаниям моделей агента и контролёра. Он обосновывает архитектурное направление, но не заменяет проверку на собственных инструментах, разрешениях и типах обратной связи. Ближайший практический шаг здесь — не внедрять весь SafeCoEvo целиком, а отделить журнал событий и обновляемую защитную обвязку от неизменной рабочей модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



