Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Проверка разрешения на каждый вызов инструмента не гарантирует, что ИИ-агент не расширит исходную задачу через новые подцели. Genliang Zhu и Chu Wang заблокировали запрещённые состояния во всех 48 опасных сценариях, хотя работа не рецензирована и числа получили сами авторы. Для длительных задач это переносит контроль доступа с отдельных API-вызовов на весь меняющийся план.
Проблема возникает, когда несколько допустимых действий образуют запрещённую последовательность. Например, агенту разрешено выбрать непроверенную сборку и отдельно направить на неё производственный трафик, но выполнять второе действие до независимой проверки нельзя. Обычный список разрешений видит два допустимых вызова и не учитывает их порядок, незакрытое обязательство и уже выполненные шаги.
Предложенный механизм начинает с утверждённого корневого контракта задачи. В нём задают допустимые состояния и последовательности действий, границы ресурсов, обязательства и условие завершения. Когда агент создаёт или заменяет подцель, передаёт её другому исполнителю либо объединяет результаты веток, он должен приложить проверяемое свидетельство: новая ветка не расширяет контракт и рассчитана для текущих версий политики и состояния. Свободный текст агента разрешений не даёт.
Перед внешним действием система повторяет проверку на границе атомарной фиксации: эффект либо проходит целиком, либо не выполняется. Полный механизм завершил все парные безопасные сценарии. Сравнение, которое учитывало только историю действий, пропустило нарушения в 11 случаях: они зависели от типов ресурсов, актуальности данных или доказательства корректного объединения веток.
Проверка охватывала конечные структурированные области, одного владельца задачи и один корневой контракт. Эксперименты включали четыре операционные области и два открытых пути выполнения инструментов. Гарантии требуют, чтобы все защищённые эффекты проходили через общий адаптер, а описание состояний и действий верно отражало систему. Поэтому подход подходит не как универсальная проверка рассуждений LLM, а как архитектура для агентов, чьи операции уже можно выразить через типизированные контракты и контролируемую точку фиксации.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



