Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
ИИ-агента научили пересматривать ещё не выполненную часть плана, не отбрасывая уже полученные результаты. В нерецензированном препринте, где все числа получили сами авторы, TROVE чаще конкурентов сочетал высокое качество ответа с коротким временем выполнения. Для агентных систем это промежуточный вариант между жёстким процессом и полным перепланированием после каждого шага.
Маршрут остаётся планом, а не обязательством
Заранее собранный процесс устаревает прямо во время исполнения. Проверка может найти ошибку и потребовать исправления, успешный тест — сделать следующую проверку ненужной, а сбой инструмента — лишить смысла все зависимые от него шаги.
Обычные оркестраторы решают эту проблему одним из двух способов. Фиксированный процесс продолжает выполнять устаревший план, а реактивный агент заново выбирает действие после каждого результата. Первый тратит вызовы модели и распространяет ошибки, второй добавляет задержку и может случайно заменить часть маршрута, которая работала правильно.
TROVE разделяет предложение маршрута и обязательство его выполнить. Планировщик может предложить до четырёх верхнеуровневых навыков, но контроллер запускает только первый. После него система проверяет статус, доступные промежуточные материалы и признаки завершения задачи; всего она допускает до шести таких вызовов.
Дальше контроллер выбирает одно из трёх действий. Он сохраняет остаток маршрута, если следующий навык всё ещё подходит; вставляет локальный ответ вроде исправления или теста; либо заменяет только недействительный остаток. Уже выполненные шаги и созданные ими материалы остаются на месте.
В примере с HotpotQA проверка обнаружила, что черновику не хватает доказательства. Фиксированный процесс перешёл к форматированию и получил неверный ответ. TROVE вставил исправление, после чего убрал ставший ненужным остаток маршрута и завершил задачу.
Опыт поиска превращается в навыки и переходы
Перед запуском TROVE разбирает следы поиска процессов AFlow. Каждый такой след показывает последовательность операций, промежуточные результаты и то, как локальное изменение процесса повлияло на качество и время. Для тестовых задач эти структуры уже не меняются.
Стабильные фрагменты система сворачивает в составные навыки. Такой навык объединяет несколько операций с постоянным порядком и единым входом и выходом: например, генерацию решения и стандартную внутреннюю проверку. Контроллер видит его как один шаг и не тратит отдельные решения на предсказуемые переходы.
Если продолжение зависит от результата, фрагмент не сворачивают. Вместо этого переход сохраняют в графе вместе с наблюдаемым событием: успешным тестом, найденной ошибкой или появлением нужного материала. Во время исполнения граф предлагает только ближайший подходящий навык, а не строит весь процесс заново.
Разбор компонентов показывает разницу ролей. Составные навыки дали основную пользу от предварительно собранного опыта. Вставка локального шага чаще помогала исправить ответ, а замена остатка маршрута прежде всего убирала ненужную работу и помогала выйти из неподходящего продолжения.
Командам стоит проверить границы между шагами
TROVE проверяли на HumanEval, MBPP, DROP, HotpotQA, MATH и GSM8K с DeepSeek-V4-Flash, GPT-4o-mini и Qwen3-8B. В сравнение вошли AFlow с одним процессом на датасет, MaAS с выбором архитектуры до запуска и LAS с динамическим переходом внутри заданного графа.
TROVE показал лучший или равный лучшему результат в 15 из 18 сочетаний модели и задачи, а минимальное онлайн-время — в 16 из 18. Относительно AFlow прирост метрики задачи доходил до 31,37 процентного пункта, сокращение времени — до 86,7%. На DeepSeek-V4-Flash суммарный расход онлайн-токенов снизился на 36,3%.
Качество измеряли по-разному: долей прошедших решений для кода, точностью для математики и средней F1 по токенам для ответов на вопросы. Сравнивать абсолютные баллы между этими группами нельзя. Замер времени включал онлайн-планирование, исполнение и перепланирование, но не предварительный поиск процессов и сбор реестра навыков, поэтому экономия относится именно к эксплуатации готовой системы.
Работа меняет планы прежде всего там, где агент выполняет длинную цепочку дорогих вызовов, сохраняет промежуточные материалы и получает проверяемый результат после каждого этапа. В такой архитектуре полезно хранить маршрут отдельно от состояния исполнения, фиксировать контракт каждого навыка и разрешать контроллеру менять только ещё не выполненный остаток.
Переписывать оркестратор целиком ради TROVE рано: метод проверяли на задачах с чёткими автоматическими оценками и следами AFlow. Практический следующий шаг — добавить в существующий процесс границы наблюдения и три операции над маршрутом: сохранить, вставить, заменить. Если локальная вставка сокращает число полных перезапусков без потери качества, селективное перепланирование можно переносить на более длинные рабочие процессы.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



