Журнал · Rit.work

SafeCoEvo обновляет защиту LLM-агента на двух скоростях

SafeCoEvo превращает историю действий LLM-агента в обновляемые правила и обучает отдельный контролёр риска, не меняя основную модель.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Внешняя защита LLM-агента научилась улучшаться на прошлых сбоях прямо во время эксплуатации, не меняя модель, которая выполняет задачи. В препринте East China Normal University, Huawei Noah’s Ark Lab и партнёров SafeCoEvo одновременно превзошёл сильнейший из сопоставимых методов по безопасности и успешности задач, хотя работу не рецензировали и все числа получили сами авторы. Для продукта это предлагает промежуточный путь между неизменными правилами и регулярным переобучением основной модели.

Опыт превращается сначала в правила, затем в параметры

SafeCoEvo оставляет рабочую LLM замороженной и обновляет два внешних компонента. S-Harness хранит явные инструкции и ограничения, а отдельная модель-контролёр решает, безопасно ли конкретное действие агента.

После каждой завершённой задачи система получает траекторию выполнения и обратную связь. Этот опыт может повлиять только на следующие задачи: SafeCoEvo не возвращается к будущим примерам и не прогоняет один набор заданий многократно. Такое условие отличает работу от методов, которые оптимизируют агента на заранее доступной выборке.

S-Harness обновляется после каждой задачи. Он распределяет полезный опыт между системной инструкцией по безопасности, проверенной памятью, навыками, политикой разрешений и правилами реакции на решения контролёра. Локальная ошибка при этом должна превратиться в обобщённое правило без названия набора испытаний, идентификатора задания и точного исходного примера.

Это быстрый слой адаптации: новое ограничение начинает действовать уже на последующих заданиях. Но явные правила со временем накапливаются, повторяются и могут конфликтовать, поэтому SafeCoEvo добавляет более медленный контур.

GuardVPO периодически обучает модель-контролёр на отдельных событиях из траекторий. Для каждого вызова сохраняются контекст, предполагаемое действие, решение «безопасно» или «опасно» и итоговая обратная связь. Ошибка, при которой опасное действие пропустили, наказывается сильнее лишней блокировки; отдельный штраф удерживает обновлённую модель рядом с исходной и ограничивает резкие изменения.

Два контура используют одну историю, но по-разному. S-Harness быстро записывает опыт в редактируемую форму, а GuardVPO постепенно превращает повторяющиеся закономерности в способность оценивать риск. Основную LLM при этом не переобучают и не развёртывают заново.

Небезопасных исходов стало меньше без потери полезности

Метод проверяли на Agent-SafetyBench и Agent Security Bench. Поток включал 1 024 последовательных эпизода; отдельная тестовая часть содержала сценарии, которых не было во время адаптации. В качестве рабочей модели использовали DeepSeek-v4.1-Flash, а начальным контролёром служил AgentDoG1.5-Unified-Qwen3.5-4B. Также авторы повторили часть сравнений с Qwen3.7-Flash и SingGuard.

В полном потоке доля эпизодов с небезопасным исходом составила 14,01% против 24,06% у SHE, сильнейшего метода сравнения с обновляемой защитной обвязкой. Одновременно доля успешно выполненных исходных задач достигла 76,08% против 63,93%. Значит, преимущество не свелось к более частым запретам: агент реже допускал опасный результат и чаще завершал задачу.

Разбор компонентов показывает разный вклад двух контуров. Одно обновление S-Harness дало основную прибавку относительно полностью статичной конфигурации, а обучение контролёра дополнительно улучшило результат после накопления событий. Отдельные проверки на R-Judge и ATBench также показали, что контролёр стал лучше замечать опасные события за пределами исходного потока, но немного хуже распознавал безопасные.

Что менять в архитектуре агентного продукта

Работа меняет планы команд, которые собирались закрепить защиту один раз перед запуском. SafeCoEvo показывает более гибкую схему: вынести безопасность из основной модели, обновлять явные правила после отдельных задач, а модель оценки риска обучать реже на накопленной истории.

Для такой схемы недостаточно хранить только финальный ответ агента. Система должна записывать контекст каждого проверяемого действия, решение контролёра и последующий результат. Нужна и достоверная обратная связь после завершения задачи: без неё невозможно понять, какое разрешение оказалось опасным, а какая блокировка была лишней.

Метод особенно уместен там, где основную модель дорого или рискованно регулярно менять, но защитный слой можно развивать отдельно. Быстрые исправления остаются читаемыми правилами, а устойчивые повторяющиеся случаи переходят в параметры меньшей специализированной модели.

Пока результат относится к последовательным потокам двух наборов испытаний и нескольким сочетаниям моделей агента и контролёра. Он обосновывает архитектурное направление, но не заменяет проверку на собственных инструментах, разрешениях и типах обратной связи. Ближайший практический шаг здесь — не внедрять весь SafeCoEvo целиком, а отделить журнал событий и обновляемую защитную обвязку от неизменной рабочей модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу