Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агента научили выходить из уже нарушенного безопасного состояния за несколько действий, не ухудшая отдельные сбои. Команда Chenyu Zhou назвала подход SiLR: он восстановил систему в 21 из 21 эпизода против 9 у лучшего скалярного ограничителя, хотя работу пока не рецензировали и числа получили сами авторы. Для защиты во время работы это меняет критерий допуска: одной общей оценки ущерба недостаточно.
Обычный ограничитель сводит состояние системы к одному штрафу и пропускает действие, если штраф уменьшается. Но в цикле ReAct принятое действие прекращает поиск на текущем шаге, поэтому ограничитель фактически выбирает дальнейший путь агента. SiLR сначала выполняет предложенное действие в копии детерминированного симулятора, затем проверяет, что не появились новые нарушенные участки и не выросла тяжесть нарушения на каждом прежнем участке.
Общая сумма может скрыть опасное перераспределение. Например, действие меняет тяжесть двух нарушений с 10 и 10 на 19 и 0,1: сумма снижается с 20 до 19,1, но один участок становится почти вдвое хуже. Скалярный фильтр принимает такой шаг и может завести восстановление на плато, а покомпонентная проверка SiLR отклоняет его и просит агента предложить другое действие.
Основные опыты провели с Qwen3-14B в симуляторе электросети Gym-ANM; полный набор включал 24 сценария, где восстановление требовало нескольких действий. Тот же критерий проверили с семействами Qwen, Gemma и Llama, а также в CityLearn на ограничениях энергии и комфорта. Поэтому результат относится к задачам, где инструмент можно безопасно и детерминированно выполнить на копии состояния до применения в рабочей системе.
Ту же структуру нарушений использовали как сигнал награды за промежуточные шаги при обучении через GRPO. После снятия ограничителя доля успешных восстановлений у обученной политики составила 0,844 против 0,778 у базовой модели. Награда, основанная только на числе нарушений, не различает частичное улучшение и перенос ущерба между участками, поэтому агент хуже усваивает сам способ восстановления.
Источники
Иллюстрация: рисунок из статьи «SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents», Chenyu Zhou, Qiliang Jiang, Shuning Wu и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



