Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LLM-агента можно обучить пропускать новое рассуждение, пока предыдущий план всё ещё поддерживает следующие действия. Yiruo Cheng и коллеги описали RACE: на четырёх задачах метод сократил расход токенов рассуждения при сопоставимом качестве, хотя работа не рецензирована и числа получены самими авторами. Для продукта это превращает рассуждение перед каждым шагом из обязательного режима в решение, которому можно обучить модель.
Как измеряли полезность предыдущего рассуждения
Обычный многошаговый агент сначала рассуждает, затем вызывает инструмент или выполняет другое действие и получает ответ среды. На следующем шаге цикл повторяется, даже если агент уже построил план и новое наблюдение ничего в нём не изменило.
Прямой способ найти лишние рассуждения — убрать один такой фрагмент, заново сгенерировать действие и проверить, совпало ли оно с правильным. Для длинной траектории процедуру приходится повторять для многих шагов и вариантов. При обучении с подкреплением это особенно дорого: политика агента меняется, поэтому проверку нужно снова проводить на свежих траекториях.
Вместо повторной генерации RACE оценивает, насколько после удаления рассуждения падает вероятность уже известного правильного действия. Если прежний план по-прежнему достаточен, модель сохраняет высокую вероятность нужной команды. Если контекст изменился и требуется пересмотреть решение, вероятность заметно падает.
Алгоритм LoGiC последовательно проверяет рассуждения после первого шага. Для каждого кандидата он временно удаляет текст рассуждения и пересчитывает вероятность текущего и всех последующих правильных действий. Удаление принимается, только если падение везде остаётся ниже заданного порога; принятые изменения переносятся в следующие проверки.
Оставшиеся фрагменты образуют минимальное покрытие траектории рассуждениями. Здесь важно, что LoGiC оценивает не только ближайшее действие: ранний план может поддерживать несколько следующих шагов, а его удаление — повредить результат лишь позднее.
Полученные траектории используют на двух этапах. Сначала модель дообучают с учителем на примерах, где перед частью действий рассуждения уже удалены. Затем при обучении с подкреплением LoGiC анализирует успешные траектории текущей политики: лишние фрагменты исключают из обновления модели, а завершение рассуждения в этих местах обучают отдельно. Неуспешные траектории обрабатывает стандартный GRPO.
Экономия возникает за счёт пропуска шагов, а не коротких ответов
В сравнении со стандартной связкой дообучения с учителем и GRPO расход токенов рассуждения снизился на 32,3% в ScienceWorld, 80,2% в WebShop, 46,4% в AppWorld и 62% в DeepSearch. Разница в доле успешно выполненных заданий не превышала 1,4 процентного пункта.
RACE не просто заставляет модель писать короче. После обучения агент чаще сразу выполняет действие, но на сложных шагах может рассуждать подробнее. Это полезное различие для архитектуры: жёсткий лимит одинаково обрезает и лишний текст, и нужное планирование, тогда как RACE учит выбирать момент для нового плана.
Метод проверяли на моделях Qwen3.5 разных размеров. ScienceWorld охватывает задачи в научной симуляции, WebShop — покупки в веб-среде, AppWorld — работу с приложениями, DeepSearch — поиск и сбор знаний. Сравнение относится к многошаговым агентам, которые видят действия и ответы среды, а не к одиночным ответам модели.
Когда RACE меняет планы разработки агента
Работа меняет планы команд, которые обучают собственную политику агента и уже собирают успешные траектории. Вместо правила «рассуждать перед каждым вызовом инструмента» можно хранить полные траектории, оценивать вклад каждого фрагмента и готовить по ним данные для дообучения.
Для этого нужен доступ к вероятностям токенов и к обучению модели. Команда, которая только вызывает закрытую модель через API, не получает из RACE готового переключателя: решение о пропуске рассуждения формируется во время дообучения с учителем и обучения с подкреплением.
Практический ориентир — не сокращать каждое рассуждение, а искать участки, где один план переживает несколько действий. Особенно естественно это выглядит в сценариях с повторяющимися вызовами инструментов: навигации по приложению, последовательном поиске, работе с каталогом или управлении средой.
Работа измеряет расход токенов рассуждения, а не задержку или денежную стоимость исполнения. Поэтому перед изменением производственной архитектуры экономию придётся перепроверить на собственных моделях, длине контекста и инфраструктуре.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



