Журнал · Rit.work

План повышает успех агента, проверка снижает риск ошибки

Готовый план повысил долю успешных задач, но при высокой цене ошибки отдельный верификатор оказался выгоднее полного контура агента.

Rit.work
Студия разработки
18 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Готовые планы помогают LLM-агентам выполнять сложные задачи, а отдельная проверка лучше защищает от принятия ошибочного результата. В препринте Yukun Zhang, Kemu Xu и Yishen Chen, который не прошёл рецензирование и где числа получили сами авторы, план Fixed повысил долю успешных задач на 7,17 процентного пункта. Выбор между планом и проверкой зависит от того, сколько продукт теряет при ошибочном пропуске.

Авторы сравнили заранее написанный план для конкретной задачи с Sham — перемешанными словами из правил предметной области. Тексты совпадали по объёму и способу подачи, поэтому сравнение отделяло пользу инструкций от эффекта более длинного контекста. План добавляли статически, без отдельного вызова модели во время выполнения; основной прирост пришёлся на задачи с большим числом зависимых действий.

Второй компонент проверял результат после завершения работы. В Retail верификатор отклонил 61% неверных результатов, но вместе с ними заблокировал 17% правильных. Проверка только читала недавний диалог и стоила меньше одного цента на эпизод, однако не отменяла уже выполненные возвраты, отмены и другие изменения состояния.

Отдельный верификатор сократил ошибочные пропуски на 48,4 процентного пункта против 49,8 у полного контура с планированием и проверкой. При этом его дополнительные расходы составили двенадцатую часть расходов полного варианта. Поэтому при невысокой цене ошибки больше пользы даёт план, который повышает шанс завершить задачу; при высокой цене безопаснее сначала поставить проверку на выходе.

Эксперименты охватывали несколько моделей в Retail и небольшой пилот Airline из τ²-bench. Агенты работали с инструментами и меняли устойчивое состояние систем, а правильность определял скрытый эталон, а не заявление самого агента. Результат показывает поведение компонентов в задачах обслуживания клиентов и авиаперевозок, а не универсальное преимущество для любых агентных сценариев.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу