Журнал · Rit.work

Подцели ИИ-агента предлагают проверять как часть разрешённого плана

Новый механизм проверяет не только отдельные вызовы инструментов, но и то, остаются ли новые подцели ИИ-агента в границах исходной задачи.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Проверка разрешения на каждый вызов инструмента не гарантирует, что ИИ-агент не расширит исходную задачу через новые подцели. Genliang Zhu и Chu Wang заблокировали запрещённые состояния во всех 48 опасных сценариях, хотя работа не рецензирована и числа получили сами авторы. Для длительных задач это переносит контроль доступа с отдельных API-вызовов на весь меняющийся план.

Проблема возникает, когда несколько допустимых действий образуют запрещённую последовательность. Например, агенту разрешено выбрать непроверенную сборку и отдельно направить на неё производственный трафик, но выполнять второе действие до независимой проверки нельзя. Обычный список разрешений видит два допустимых вызова и не учитывает их порядок, незакрытое обязательство и уже выполненные шаги.

Предложенный механизм начинает с утверждённого корневого контракта задачи. В нём задают допустимые состояния и последовательности действий, границы ресурсов, обязательства и условие завершения. Когда агент создаёт или заменяет подцель, передаёт её другому исполнителю либо объединяет результаты веток, он должен приложить проверяемое свидетельство: новая ветка не расширяет контракт и рассчитана для текущих версий политики и состояния. Свободный текст агента разрешений не даёт.

Перед внешним действием система повторяет проверку на границе атомарной фиксации: эффект либо проходит целиком, либо не выполняется. Полный механизм завершил все парные безопасные сценарии. Сравнение, которое учитывало только историю действий, пропустило нарушения в 11 случаях: они зависели от типов ресурсов, актуальности данных или доказательства корректного объединения веток.

Проверка охватывала конечные структурированные области, одного владельца задачи и один корневой контракт. Эксперименты включали четыре операционные области и два открытых пути выполнения инструментов. Гарантии требуют, чтобы все защищённые эффекты проходили через общий адаптер, а описание состояний и действий верно отражало систему. Поэтому подход подходит не как универсальная проверка рассуждений LLM, а как архитектура для агентов, чьи операции уже можно выразить через типизированные контракты и контролируемую точку фиксации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу