Журнал · Rit.work

CIPO учит ИИ-агента выбирать между отдельным вызовом и готовым сценарием

CIPO сравнивает последствия атомарного вызова и составного навыка из одного состояния, чтобы ИИ-агент сокращал цепочки действий без потери контроля.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Агента с составными инструментами научили выбирать, когда выполнить готовую последовательность действий, а когда сохранить пошаговый контроль. Команда Southeast University, KTH и Huawei назвала метод CIPO и получила лучший результат среди выбранных подходов, хотя препринт не рецензирован и числа в нём получили сами авторы. Для команд, которые обучают собственных агентов, работа меняет акцент: мало собрать библиотеку сценариев, нужно отдельно обучить модель выбирать подходящий уровень детализации.

Готовый навык полезен не в каждом состоянии

Агенты обычно работают с атомарными инструментами: прочитать файл, выполнить команду, запросить API. Повторяющуюся цепочку таких вызовов можно оформить как составной навык и предоставить модели одним действием — например, сначала найти документ, затем прочитать его и извлечь ответ.

Такой навык сокращает число решений, но скрывает промежуточные результаты. Если следующий шаг зависит от содержимого файла или инструмент вернул неожиданный ответ, агенту выгоднее действовать по одному вызову. Когда процедура заранее понятна, пошаговый выбор только удлиняет траекторию.

В предварительном разборе состояний навыки давали лучший результат в 37% случаев, атомарные инструменты — в 21%. В остальных случаях варианты были сопоставимы. При этом обычное обучение по примерам и GRPO с доступом к навыкам не воспроизводили эту зависимость: модель знала о составных действиях, но не научилась выбирать их по ситуации.

Авторы также не объединяют все часто соседствующие вызовы. Такое объединение создаёт пересекающиеся варианты одного сценария и усложняет выбор. CIPO ищет повторяющиеся последовательности в успешных траекториях по принципу BPE: последовательно соединяет частые соседние действия, но ограничивает размер библиотеки и длину навыка.

Как контрфактическая развилка показывает цену решения

Найденную последовательность недостаточно записать как список вызовов. CIPO превращает её в исполняемый инструмент: определяет внешние параметры, передаёт результаты между внутренними шагами и оставляет модели выбор элемента, если один из вызовов вернул несколько кандидатов.

Во время исполнения система сохраняет трассировку каждого внутреннего шага. Если вызов завершился ошибкой или дальнейшее действие невозможно, навык возвращает промежуточный результат и передаёт управление агенту. Поэтому составное действие не становится непрозрачным сценарием, который можно только выполнить целиком или отбросить.

Главная часть метода относится к обучению. Для базовой траектории CIPO находит первое состояние, где доступны и атомарный вызов, и связанный с ним навык. Затем создаёт вторую ветку: заменяет исходный выбор альтернативой и продолжает выполнение той же моделью.

Получаются два продолжения из одинакового состояния. Разница итоговых наград показывает, помогло ли укрупнение действия именно в этом месте. CIPO добавляет эту разницу к сигналу GRPO, а награду за выполнение всей задачи сохраняет как основную.

Ветвление в первой подходящей точке оказалось полезнее случайного выбора точки при одинаковом бюджете траекторий. Раннее решение влияет на более длинное продолжение, поэтому сравнение даёт модели больше информации о последствиях выбранной детализации.

Метод проверяли на трёх наборах задач — TOOLATHLON, TOUCAN и TRAJECT-Bench — с базовыми моделями Qwen2.5-7B и Llama3.1-8B. В сравнение вошли обычные агенты с инструментами, подходы с памятью и рабочими процессами, а также методы, которые составляют навыки или объединяют вызовы.

Командам придётся обучать выбор, а не только собирать сценарии

В среднем доля успешно выполненных задач у CIPO достигла 36,48% против 29,30% у GRPO с той же возможностью вызывать навыки. Число решений модели относительно развёрнутой последовательности атомарных действий сократилось на 15,5% против 8,8%. Значит, прибавку нельзя объяснить одним появлением составных инструментов: контрфактическое сравнение дало дополнительный эффект.

Работа меняет планы команд, которые уже собирают успешные траектории и готовы дообучать агента с подкреплением. Вместо глобальной замены мелких API-вызовов готовыми сценариями стоит сохранить оба варианта действий, ограничить библиотеку навыков и добавить в обучение пары продолжений из одного состояния.

Для агента, который использует закрытую модель только через API и не проходит собственное обучение, CIPO не служит готовой заменой диспетчеру инструментов. Его практическая часть требует истории успешных запусков, исполняемых составных действий и возможности менять политику модели.

Замеры показывают качество траекторий, долю выполненных задач и число решений модели. Они не устанавливают, как сокращение решений повлияет на задержку и стоимость рабочего сервиса: внутренние шаги навыка всё равно вызывают атомарные инструменты. Поэтому CIPO обосновывает новый план обучения, но не обещает такое же сокращение инфраструктурных расходов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу