Журнал · Rit.work

GRAFT считает вклад шагов агента по графу траекторий

GRAFT объединяет траектории LLM-агента в граф и оценивает пользу каждого шага без повторной генерации из промежуточных состояний.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В многошаговом обучении LLM-агента можно отделить полезное действие от итогового провала, не запуская дополнительные генерации из каждого промежуточного состояния. GRAFT обошёл GRPO и другие методы обучения агентов на задачах с несколькими действиями, сохранив разреженную награду только за конечный результат. В препринте, который не проходил рецензирование, все числа получили сами авторы; подход предлагает точнее обучать агентов без отдельной модели, оценивающей каждый шаг.

Почему итоговая награда искажает вклад отдельных действий

GRPO — метод обучения с подкреплением, который сравнивает несколько ответов модели на один запрос. Средняя награда группы показывает ожидаемый результат из исходного состояния, а разница между результатом конкретного ответа и средним показывает его преимущество.

Для цельного ответа такая оценка соответствует определению преимущества в обучении с подкреплением. Но агент работает иначе: выполняет действие, получает новое состояние, снова выбирает действие и продолжает до успеха или провала. Один итог приходится распределять по всей цепочке.

Из-за этого успешная траектория награждает в том числе лишние или ошибочные действия. Неудачная траектория, напротив, штрафует полезный шаг, после которого агент ошибся позднее. Сравнивать действия по их порядковому номеру тоже нельзя: на одном и том же шаге разные траектории обычно уже находятся в разных состояниях.

Точная оценка потребовала бы несколько раз продолжить генерацию из каждого промежуточного состояния и усреднить результаты. Стоимость таких запусков растёт квадратично с числом исходных траекторий и дополнительно зависит от их длины. Альтернатива в виде модели награды за процесс требует разметки отдельных шагов и может хуже работать на рассуждениях, которые отличаются от обучающих примеров.

Как граф заменяет повторные запуски

GRAFT берёт уже полученные траектории для одной задачи и превращает их в направленный граф. Узел обозначает состояние агента, ребро — выполненное действие, а конечному узлу соответствует успех или провал.

Одинаковые состояния из разных траекторий сливаются. Для состояний, которые среда задаёт готовой строкой, подходит точное совпадение. Если состояние включает свободный текст модели, GRAFT сравнивает его смысловые представления и объединяет достаточно близкие варианты.

Слияние создаёт естественную группу действий из одного состояния. Например, несколько траекторий могли разными путями привести агента к одной странице магазина или к одной конфигурации предметов в среде. Их дальнейшие действия теперь можно сравнить без новых запусков модели.

Затем конечные награды распространяются назад по графу с помощью итерации Беллмана. Она оценивает состояние через средний результат доступных из него действий и следующих состояний. Процесс повторяется, пока оценки узлов не перестанут заметно меняться.

Преимущество действия считают как разницу между ценностью следующего и текущего узла с поправкой на будущую награду. Положительное значение означает, что действие приблизило агента к более перспективному состоянию; отрицательное — что оно ухудшило положение. Так полезный переход внутри провальной траектории может получить положительную оценку.

Graph GAE дополняет расчёт сведениями из нескольких следующих переходов. Это снижает влияние ошибки в ценности одного узла: обучение опирается не только на ближайший шаг, но и на продолжение пути по графу.

Когда GRAFT меняет план обучения агента

Метод проверяли на ALFWorld, WebShop и SearchQA: это задачи с взаимодействием со средой, покупками и поиском информации. Основные разборы затрат и компонентов провели с Qwen2.5-1.5B-Instruct; в приложении также приведены опыты с моделями серии Qwen3. Сравнение охватывает GRPO, GiGPO и другие алгоритмы пошагового распределения награды.

На WebShop полный GRAFT довёл долю успешных заданий до 82,27% против 80,67% у варианта без скорректированной цели GRPO и Graph GAE. Если убрать нормализацию преимуществ, результат падает до 72,93%. Значит, основную схему нельзя свести к одному распространению конечной награды по графу: способ подготовить оценки для обновления модели заметно влияет на обучение.

Построение графа и расчёт преимуществ заняли 0,43% времени шага обучения. GRAFT не добавляет ещё одну модель и не требует дополнительной памяти GPU под неё; основные расходы по-прежнему приходятся на генерацию траекторий и обновление политики.

Работа меняет планы команд, которые уже обучают агентов по конечной проверяемой награде и получают повторяющиеся состояния в разных траекториях. В таком контуре граф можно встроить между сбором запусков и обновлением модели, не меняя среду и формат награды.

Польза зависит от того, удаётся ли надёжно распознать одно и то же состояние в разных запусках. В структурированной среде достаточно точного совпадения; в свободном тексте результат уже зависит от смыслового сопоставления. Проверки охватывают три исследовательские среды и модели Qwen, поэтому перенос на производственные браузерные или программные агенты потребует отдельного замера.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу