Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агента научили выборочно возвращаться к прошлым шагам, чтобы исправлять накопившиеся ошибки и не тратить токены на лишние проверки. ForkPilot сократил расход токенов до 59,2% при качестве, сопоставимом с лучшими подходами, хотя препринт не рецензирован и числа в нём получили сами авторы. Для продуктовой команды это способ вынести повторный поиск в отдельную обучаемую стратегию, а не запускать его после каждого сомнительного действия.
Почему агенту недостаточно просто вернуться назад
Агенты для длинных задач вызывают модель и инструменты много раз подряд. Ошибка в факте, промежуточном выводе или выбранном действии переходит в следующие шаги, поэтому поздний результат может оказаться неверным даже при разумных действиях ближе к концу.
Ретроспективный поиск позволяет вернуться к более раннему состоянию, выбрать другую ветку и продолжить работу оттуда. Но сам возврат расходует токены и вычисления. Если запускать его слишком часто, агент перепроверяет удачные решения; если слишком редко — не успевает исправить ошибку.
ForkPilot рассматривает ценность такого поиска как величину, которая меняется по ходу задачи. Потенциальная польза зависит от текущих наблюдений и уже собранных свидетельств, а стоимость — от дополнительного рассуждения и повторных действий. Поэтому решение, полезное в начале траектории, позже может стать невыгодным.
Работа выделяет две связанные трудности. Первая возникает из-за отложенного результата: по финальному успеху сложно понять, какой промежуточный возврат действительно помог. Вторая связана с устареванием: по мере накопления новых траекторий прежняя оценка полезности поиска хуже отражает текущее поведение агента.
Как ForkPilot обновляет стратегию поиска
Система учится в два этапа. Сначала она разбирает завершённые траектории и автоматически строит сравнения их результатов. На этой основе ForkPilot обучает стратегию, которая оценивает, стоит ли запускать ретроспективный поиск в конкретной точке.
Затем агент применяет эту стратегию во время выполнения задачи и принимает решение по текущим наблюдениям. Новые завершённые траектории попадают в последующие обновления, поэтому стратегия меняется вместе с практическим опытом системы. Это отличает ForkPilot от фиксированного правила вроде возврата после ошибки инструмента или после заданного числа шагов.
Из доступного абстракта нельзя восстановить, как именно строятся сравнения результатов, какие признаки получает стратегия и как часто её обновляют. Эти детали определяют стоимость обучения и сложность внедрения, поэтому по абстракту нельзя оценить объём необходимой инфраструктуры.
Проверка охватила 6 разных бенчмарков, 7 семейств базовых LLM и 9 конкурирующих подходов. Среди моделей указаны GPT-5.6 Sol, Opus 4.8 и семейства с открытым исходным кодом; один из вариантов сравнения работал в промышленной агентной системе. Поскольку материал основан на абстракте, результаты нельзя разделить по отдельным моделям, задачам и режимам запуска.
Когда результат меняет архитектурный план
Работа предлагает отделить решение о возврате от основного рассуждения агента. В архитектуре появляется самостоятельная стратегия, которая получает текущее состояние, разрешает или отклоняет дополнительный поиск и затем дообучается на завершённых запусках. Такой слой можно развивать независимо от базовой LLM.
Эта схема требует сохранять не только финальный ответ, но и последовательность действий, наблюдения инструментов, точки возврата и итог задачи. Без завершённых траекторий ForkPilot не сможет строить сравнения и обновлять оценку полезности поиска. Команде придётся заранее определить, какой результат считать успешным и какие журналы выполнения допустимо использовать для обучения.
Заявленная экономия до 59,2% относится к токенам, а не напрямую к стоимости или задержке продукта. Абстракт не раскрывает распределение результата по сценариям, поэтому максимальное сокращение нельзя переносить в бюджет конкретного сервиса. Перед изменением производственной архитектуры стратегию придётся сравнить с текущим правилом возврата на собственных длинных задачах.
ForkPilot также не даёт причины менять выбранную базовую модель: подход проверяли на нескольких семействах, а основное изменение находится в управлении поиском. Практический вывод уже уже: если агент регулярно выполняет длинные цепочки действий и умеет возвращаться к прошлому состоянию, фиксированная частота перепроверок может расходовать лишние токены. Если задачи короткие или система не хранит состояние, добавление обучаемой стратегии потребует сначала перестроить сам контур выполнения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



