Журнал · Rit.work

SafeEvolve совместно настраивает обвязку и политику агента

Авторы SafeEvolve проверили, помогает ли совместное обновление исполняющей обвязки и политики модели защищать агентов от вредоносных запросов и внедрённых инструкций.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Qinghua Mao и соавторы представили SafeEvolve для настройки безопасности LLM-агентов в препринте, который не проходил рецензирования. По их замерам, на AgentDojo доля успешных атак для Qwen3.5-4B снизилась втрое без ухудшения выполнения обычных задач. Работа важна командам, которые строят агентов с доступом к инструментам и выбирают между внешними ограничениями, дообучением модели и сочетанием этих подходов.

Что сделали

SafeEvolve рассматривает агента как сочетание политики модели и исполняющей обвязки (harness). Политика определяет поведение модели, а обвязка задаёт доступные инструкции, инструменты, разрешения, правила обработки данных и подключаемые навыки. Авторы исходят из того, что исправлять только одну часть недостаточно: сложные внешние правила могут оказаться непосильными для модели, а дообученная политика остаётся привязанной к фиксированному окружению.

Источником изменений служат полные траектории выполнения задач: сообщения, промежуточные решения, вызовы инструментов и ответы среды. Система выделяет случаи, когда агент последовал внедрённой инструкции, выполнил вредоносный запрос, вызвал неподходящий инструмент или, наоборот, безопасно отказался, но не завершил допустимую задачу.

На стороне обвязки SafeEvolve обновляет системные инструкции и иерархический банк навыков. Каждая предлагаемая правка ограничена одним компонентом. Исходный и изменённый варианты проверяются на одинаковых задачах; правку принимают, только если она улучшает целевую оценку и не ухудшает безопасность, полезность или корректность исполнения. Принятые изменения сохраняются с версией, обоснованием и возможностью отката.

Затем авторы адаптируют саму модель в два этапа. Сначала контролируемое дообучение учит её применять извлечённые из банка навыки в нужном контексте. После этого обучение с подкреплением закрепляет поведение по оценкам проверяющих правил: для обычных заданий учитывается завершение задачи, для вредоносных запросов — безопасность, а для внедрения инструкций — одновременно безопасность и сохранение исходной цели пользователя.

Что показали

Основной показатель AgentDojo — доля успешных атак (ASR): чем она ниже, тем реже внедрённая через окружение инструкция меняет поведение агента. Для Qwen3.5-4B авторы измерили снижение ASR с 2,37% до 0,79%. Полезность на безопасных задачах при этом выросла с 59,79% до 61,86%, поэтому улучшение безопасности в этом опыте не было получено за счёт дополнительных отказов от нормальной работы.

На AgentHarm авторы также зафиксировали меньшее выполнение вредоносных запросов и более частые отказы. Опыты на AgentDyn показали, что результат зависит от модели, обвязки и модели, предлагающей изменения. Во всех случаях совместный вариант сравнивался с отдельным обновлением обвязки и отдельным обучением политики.

Перенос обвязки между моделями оказался неоднородным. Навыки, полученные на одной модели Qwen, иногда улучшали безопасность другой без дополнительного обучения, но слабая модель могла не выполнить содержащиеся в них инструкции, а у более крупной модели могла снизиться полезность под атакой. Этот результат поддерживает исходную гипотезу работы: обвязку нельзя считать независимым модулем, одинаково работающим с любой политикой.

Ограничения

Авторы проверяли SafeEvolve на AgentDojo, AgentDyn и AgentHarm, а перенос — на моделях семейства Qwen нескольких размеров. Рассмотрены вредоносные пользовательские запросы и инструкции, внедрённые через страницы, файлы или ответы инструментов. Работа не показывает, как подход ведёт себя на производственных данных, при длительном накоплении изменений, с другими семействами моделей или при изменяемом наборе инструментов: в экспериментах интерфейсы среды оставались фиксированными.

Обновлялись главным образом системная инструкция и банк навыков, поэтому результаты не распространяются автоматически на разрешения, изоляцию инструментов и другие механизмы исполнения. Предложенные изменения оценивают встроенные проверяющие правила, а не независимая внешняя проверка. В сравнении также нет оценки затрат на сбор траекторий, работу модели-предлагателя, контролируемое дообучение и обучение с подкреплением. По нему нельзя определить стоимость такого цикла или задержку между обнаружением новой атаки и выпуском исправления.

Что это значит

Работа не даёт оснований менять выбранную базовую модель только ради SafeEvolve. Она меняет архитектурный план агента: безопасность стоит проектировать как совместно тестируемые обвязку и политику, а не как системную инструкцию, добавленную после разработки, или как однократное дообучение.

Для нового продукта из этого следует практический минимум: сохранять полные траектории, разделять обвязку на версионируемые компоненты, поддерживать откат и проверять каждое изменение на одинаковом наборе безопасных и атакующих сценариев. Такая инфраструктура полезна даже без воспроизведения всего обучения SafeEvolve, поскольку позволяет связать изменение поведения с конкретной правкой.

Командам с доступом к весам модели работа даёт схему для ограниченного эксперимента: сначала проверить обновляемую обвязку, затем оценить, улучшает ли дообучение соблюдение её правил. При использовании модели только через API доступна преимущественно внешняя часть подхода; заявленный эффект совместной эволюции воспроизвести без обучения политики не получится.

Переходить к автоматическому непрерывному обновлению по этой работе рано. Авторы показали результат на исследовательских стендах, но не оценили эксплуатационную стоимость и долговременную устойчивость. Рациональное изменение планов — заложить наблюдаемость, версионирование и совместные испытания, а решение о цикле переобучения принимать после собственного пилота.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу