Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агенты надёжнее выполняют длинные задания, когда система сама запрещает преждевременные, отменённые и повторные действия. В препринте Chenyu Zhang, Wonbin Kweon и Jiawei Han, который не проходил рецензирование и содержит замеры самих авторов, строгий успех Qwen3-235B вырос с 38% до 98%. Для продуктовой команды это аргумент выносить критические правила процесса из промпта в отдельный исполняемый модуль.
Как отделили знание о состоянии от контроля действий
Обычно агентные системы проверяют целиком, поэтому трудно понять, что именно помогло: память, промпт, модель или программный контроллер. Здесь модель, правила и последовательность запросов оставили одинаковыми, а состояние задачи подключили четырьмя способами.
В базовом варианте агент видел только исходное задание и историю диалога. Во втором ему на каждом ходе показывали точный список шагов со статусами: доступен, заблокирован, завершён или отменён. Этот список строили из эталонного состояния, поэтому ошибки возникали только в том, как модель его прочитала и применила.
В третьем варианте отдельная машина состояний сама выводила указание для текущего запроса: выполнить шаг, отказаться, дождаться предпосылок или подтвердить прежнее выполнение. Агент мог проигнорировать указание. В четвёртом между агентом и исполнением ставили шлюз, который отклонял действие, если оно нарушало состояние процесса.
Машину состояний составляла сама LLM из задания и последующих изменений. Шаг считался завершённым только после проверяемого подтверждения выполнения, а отдельный сопоставитель связывал новый запрос с нужным шагом. Ответы оценивали по точному совпадению содержимого действия с динамическим эталоном, без модели-оценщика.
Проверка охватила Qwen3-235B, Qwen3.6-35B и DeepSeek V4 Pro, режимы с дополнительным рассуждением на каждом ходе и без него. Основные эпизоды моделировали закупки и выпуск программного обеспечения; перенос проверяли на вызовах реальных инструментов, τ2-bench для работы с авиакомпанией и PM-Bench для задач, привязанных ко времени и сообщениям.
Точный список шагов не заставляет модель ему следовать
На Qwen3-235B без дополнительных рассуждений строгий успех всего эпизода составил 38% с одной историей диалога, 55% с точным списком, 84% с указаниями и 98% с блокировкой действий. Эпизод засчитывали только тогда, когда агент правильно обработал каждый запрос, поэтому одна лишняя операция обнуляла результат.
Даже точный список не устранил повторы завершённых шагов и попытки выполнить отменённые. Неожиданно журнал, который агент вёл сам и который никто не проверял, оказался полезнее точного списка, подготовленного системой. Сам факт, что правильное состояние присутствует в контексте, ещё не означает, что модель применит его в нужный момент.
Дополнительные рассуждения сократили разрыв между подходами: у крупной модели указания и блокировка перестали статистически различаться. Но текстовые варианты не стали надёжными полностью. Более способная модель лучше слушается состояния, тогда как программный шлюз вообще не зависит от послушания.
У шлюза другой предел. Он блокирует только нарушения, которые умеют распознать машина состояний и сопоставитель запросов. Он не может заставить агента выполнить пропущенный шаг, а ошибка при разборе задания превращается в ошибочное правило.
Когда менять архитектуру агента
Для процессов с формальными статусами работа поддерживает архитектуру из внешнего состояния, проверяемых подтверждений и шлюза перед инструментами. К таким случаям относятся повторные платежи, отменённые заявки, обязательные предпосылки и операции, которые разрешено выполнить только один раз. Хранить эти ограничения лишь в истории диалога рискованно даже при точном описании правил.
На τ2-bench шлюз поднял долю успешно пройденных задач Qwen3-235B с 39% до 54%. Для Qwen3.6-35B результат не изменился: эта модель и без шлюза редко совершала нарушения, которые правила могли перехватить. Значит, перед внедрением стоит измерить не общую частоту ошибок, а долю ошибочных действий, которые контроллер способен однозначно запретить.
PM-Bench показал противоположную границу. Там решение зависит не столько от статуса шага, сколько от распознавания смыслового сигнала в свободном тексте. Показ журнала дал лучший результат, а принудительное применение решений сопоставителя опустило Qwen3.6-35B ниже варианта с одной историей диалога.
Планы стоит менять там, где допустимость действия можно вычислить до его выполнения. Если решение требует неоднозначной интерпретации сообщения, безопаснее показывать агенту запись или выдавать рекомендацию, но не превращать неточный классификатор в обязательный шлюз. Работа не предлагает один контроллер для всех агентов: она разделяет ошибки памяти и послушания, которые лечит более сильная связь с состоянием, и ошибки распознавания, которые такая связь закрепляет.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



