Журнал · Rit.work

TROVE перепланирует только сломанный участок маршрута ИИ-агента

TROVE сохраняет полезные шаги агентного процесса, локально исправляет маршрут после промежуточного результата и сокращает лишние вызовы моделей.

Rit.work
Студия разработки
7 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

ИИ-агента научили пересматривать ещё не выполненную часть плана, не отбрасывая уже полученные результаты. В нерецензированном препринте, где все числа получили сами авторы, TROVE чаще конкурентов сочетал высокое качество ответа с коротким временем выполнения. Для агентных систем это промежуточный вариант между жёстким процессом и полным перепланированием после каждого шага.

Маршрут остаётся планом, а не обязательством

Заранее собранный процесс устаревает прямо во время исполнения. Проверка может найти ошибку и потребовать исправления, успешный тест — сделать следующую проверку ненужной, а сбой инструмента — лишить смысла все зависимые от него шаги.

Обычные оркестраторы решают эту проблему одним из двух способов. Фиксированный процесс продолжает выполнять устаревший план, а реактивный агент заново выбирает действие после каждого результата. Первый тратит вызовы модели и распространяет ошибки, второй добавляет задержку и может случайно заменить часть маршрута, которая работала правильно.

TROVE разделяет предложение маршрута и обязательство его выполнить. Планировщик может предложить до четырёх верхнеуровневых навыков, но контроллер запускает только первый. После него система проверяет статус, доступные промежуточные материалы и признаки завершения задачи; всего она допускает до шести таких вызовов.

Дальше контроллер выбирает одно из трёх действий. Он сохраняет остаток маршрута, если следующий навык всё ещё подходит; вставляет локальный ответ вроде исправления или теста; либо заменяет только недействительный остаток. Уже выполненные шаги и созданные ими материалы остаются на месте.

В примере с HotpotQA проверка обнаружила, что черновику не хватает доказательства. Фиксированный процесс перешёл к форматированию и получил неверный ответ. TROVE вставил исправление, после чего убрал ставший ненужным остаток маршрута и завершил задачу.

Опыт поиска превращается в навыки и переходы

Перед запуском TROVE разбирает следы поиска процессов AFlow. Каждый такой след показывает последовательность операций, промежуточные результаты и то, как локальное изменение процесса повлияло на качество и время. Для тестовых задач эти структуры уже не меняются.

Стабильные фрагменты система сворачивает в составные навыки. Такой навык объединяет несколько операций с постоянным порядком и единым входом и выходом: например, генерацию решения и стандартную внутреннюю проверку. Контроллер видит его как один шаг и не тратит отдельные решения на предсказуемые переходы.

Если продолжение зависит от результата, фрагмент не сворачивают. Вместо этого переход сохраняют в графе вместе с наблюдаемым событием: успешным тестом, найденной ошибкой или появлением нужного материала. Во время исполнения граф предлагает только ближайший подходящий навык, а не строит весь процесс заново.

Разбор компонентов показывает разницу ролей. Составные навыки дали основную пользу от предварительно собранного опыта. Вставка локального шага чаще помогала исправить ответ, а замена остатка маршрута прежде всего убирала ненужную работу и помогала выйти из неподходящего продолжения.

Командам стоит проверить границы между шагами

TROVE проверяли на HumanEval, MBPP, DROP, HotpotQA, MATH и GSM8K с DeepSeek-V4-Flash, GPT-4o-mini и Qwen3-8B. В сравнение вошли AFlow с одним процессом на датасет, MaAS с выбором архитектуры до запуска и LAS с динамическим переходом внутри заданного графа.

TROVE показал лучший или равный лучшему результат в 15 из 18 сочетаний модели и задачи, а минимальное онлайн-время — в 16 из 18. Относительно AFlow прирост метрики задачи доходил до 31,37 процентного пункта, сокращение времени — до 86,7%. На DeepSeek-V4-Flash суммарный расход онлайн-токенов снизился на 36,3%.

Качество измеряли по-разному: долей прошедших решений для кода, точностью для математики и средней F1 по токенам для ответов на вопросы. Сравнивать абсолютные баллы между этими группами нельзя. Замер времени включал онлайн-планирование, исполнение и перепланирование, но не предварительный поиск процессов и сбор реестра навыков, поэтому экономия относится именно к эксплуатации готовой системы.

Работа меняет планы прежде всего там, где агент выполняет длинную цепочку дорогих вызовов, сохраняет промежуточные материалы и получает проверяемый результат после каждого этапа. В такой архитектуре полезно хранить маршрут отдельно от состояния исполнения, фиксировать контракт каждого навыка и разрешать контроллеру менять только ещё не выполненный остаток.

Переписывать оркестратор целиком ради TROVE рано: метод проверяли на задачах с чёткими автоматическими оценками и следами AFlow. Практический следующий шаг — добавить в существующий процесс границы наблюдения и три операции над маршрутом: сохранить, вставить, заменить. Если локальная вставка сокращает число полных перезапусков без потери качества, селективное перепланирование можно переносить на более длинные рабочие процессы.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу