Журнал · Rit.work

ConPAct сверяет состояние между планировщиком и исполнителем

ConPAct находит противоречия между планировщиком и исполнителем, возвращает их в цикл агента и использует согласованные взаимодействия для дообучения.

Rit.work
Студия разработки
1 октября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Разделённые ИИ-агенты научились сверять, одинаково ли планировщик и исполнитель понимают состояние среды, и исправлять разногласия до следующего действия. В работе Nanjing University, Meituan и University of Science and Technology of China доля успешных попыток в MiniGrid выросла на 15,8 процентного пункта, хотя препринт не рецензирован и числа получили сами авторы. Для систем с отдельными ролями это добавляет новый контроль: проверять нужно не только план и действие, но и факты, на которых они основаны.

Один план не гарантирует общего понимания среды

В архитектуре Plan-Act планировщик разбивает цель на подзадачи, а исполнитель выбирает конкретные действия. Они могут по-разному прочитать одно наблюдение, даже если исполнитель точно следует полученной подзадаче.

В примере с Sokoban планировщик правильно определяет положение ящика и ожидает последовательность «вправо, затем вверх». Исполнитель считает, что ящик находится на одну клетку правее, дважды толкает его вправо и заводит задачу в тупик. Оба рассуждения внутренне связны, но опираются на разные состояния среды.

Такое расхождение встретилось хотя бы один раз в 85% разобранных неудачных траекторий. Оно сохранялось при работе с изображениями и структурированным текстом, а разница между ролями превышала обычный разброс повторных ответов одной модели.

Чтобы находить конфликт, обе роли вместе с подзадачей или действием возвращают компактное описание состояния в JSON. Схема заранее задаёт поля и допустимые значения: например, положение объекта, условие для действия или достижение цели. Система сравнивает ответы на одном и том же наблюдении и отмечает поля, где значения противоречат друг другу.

Для самой проверки не нужны правильный ответ среды и отдельная модель-оценщик. Однако совпадение ответов ещё не означает, что они верны: обе роли могут одинаково ошибиться.

Контролируемые вмешательства показали, что важна именно информация о состоянии, а не дополнительный текст. Для GPT-5.6-sol корректный возврат управления планировщику при невыполнимой подзадаче вырос с 0,4% до 94,5%. Для Qwen3-VL-8B доля первых действий, которые приближали выполнимую подзадачу к цели, выросла с 32,2% до 80,9%.

Как ConPAct возвращает противоречие в цикл агента

ConPAct-I запускает сверку в момент передачи управления между ролями. Если значения расходятся, система приостанавливает действия в среде и возвращает обеим ролям спорные поля вместе с их прежними ответами.

Планировщик и исполнитель повторно изучают свои наблюдения, обмениваются объяснениями и могут изменить описание состояния. Вместе с ним они пересматривают подзадачу или следующее действие. Система снова сравнивает поля и продолжает цикл, пока ответы не совпадут либо не закончится отведённый бюджет обсуждения.

Такой контур отличается от свободной самопроверки. Модель не получает общую просьбу «найти ошибку», а видит конкретное противоречие: одна роль считает проход свободным, другая — заблокированным. Проверка остаётся программной, поэтому для неё не требуется ещё один вызов модели в роли судьи.

Для обучения предложены два варианта. ConPAct-S собирает траектории с включённой сверкой и оставляет согласованные фрагменты работы, а также диалоги, в которых роли устранили конфликт. Ошибочные ответы сохраняются в контексте, чтобы модель видела причину исправления, но обучается она только на допустимом согласованном ответе.

ConPAct-R подходит, если у команды уже есть траектории ReAct. Учитель разбивает записанную последовательность действий на подзадачи, добавляет описания состояния и восстанавливает обмен между ролями. Возле неудачных действий он создаёт примеры ошибочного понимания и последующего исправления, не меняя исходную последовательность действий.

Командам стоит добавить контракт состояния до нового обучения

Работа меняет план разработки для систем, где планировщик и исполнитель вызываются отдельно. Между ними полезно передавать не только текстовую подзадачу, но и машиночитаемый контракт состояния: небольшой набор фактов, которые обе роли обязаны заполнить по одинаковой схеме.

Первый практический шаг не требует дообучения. Можно выбрать факты, от которых зависит следующее действие, сравнивать их на границе ролей и приостанавливать необратимые операции при конфликте. Логи расхождений затем покажут, какие поля стоит включить в обучающие примеры.

Цикл согласования добавляет вызовы модели и задержку, поэтому его разумно запускать на передачах управления и перед действиями с заметными последствиями, а не после каждого рассуждения. Если состояние нельзя выразить компактными взаимоисключающими значениями, программное сравнение потребует отдельной нормализации.

Основные проверки прошли в Sokoban, Crafter, Procgen и MiniGrid/BabyAI с моделями семейств Claude, GPT, Kimi и Qwen. Среды охватывают изображения и текстовые состояния, однородные и смешанные пары моделей, но остаются игровыми и имеют доступное для оценки истинное состояние. Поэтому работа обосновывает сам механизм сверки, а не перенос конкретного размера выигрыша на браузерную автоматизацию или бизнес-процессы.

ConPAct не заменяет качество планирования и исполнения. Он закрывает более узкий сбой: две способные роли принимают разумные решения о разных версиях одной и той же ситуации.

Источники

Иллюстрация: рисунок из статьи «Consistent Plan-Act for Long-Horizon Agentic Tasks», Heng-Zhuang Li, Yi-Kai Zhang, Yu Wang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу