Журнал · Rit.work

RELACE уточняет вклад шагов LLM-агента без отдельного критика

RELACE связывает итоговую награду с отдельными действиями LLM-агента без модели-критика и дополнительных авторегрессионных прогонов.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Длинного LLM-агента научились точнее связывать итог задачи с отдельными действиями, не обучая отдельную модель для оценки каждого шага. В препринте Columbia University и Zoom, который не прошёл рецензирование и содержит замеры самих авторов, RELACE обошёл GiGPO на WebShop на 5,60 процентного пункта. Метод предлагает более детальный обучающий сигнал без дополнительных авторегрессионных прогонов.

Почему итоговая награда плохо оценивает отдельные действия

Агент в WebShop последовательно ищет товар, проверяет свойства и оформляет покупку. В ALFWorld он планирует действия в виртуальном доме. В обоих случаях награда часто приходит только в конце, когда уже выполнена длинная цепочка шагов.

GRPO сравнивает несколько прогонов одной задачи и назначает действиям преимущество — число, которое показывает, стоит ли повышать вероятность такого поведения. Но при одной итоговой награде все шаги успешной или неуспешной траектории получают одинаковую оценку. Поздняя ошибка поэтому обесценивает и полезные ранние действия.

GiGPO уточняет сигнал: он группирует действия, сделанные из одинакового наблюдаемого состояния, и сравнивает дальнейшие результаты. Проблема остаётся, потому что результат зависит не только от оцениваемого действия, но и от всех следующих решений. Редкое действие со случайно удачным продолжением может получить слишком высокий вес.

Отдельный критик мог бы прогнозировать будущую награду для каждого состояния, но его тоже нужно обучать и размещать в памяти. RELACE сохраняет схему без критика и использует уже собранную траекторию, чтобы проверить связь каждого действия с финалом.

Как RELACE измеряет важность шага

После завершения эпизода RELACE берёт выполненное действие и дважды оценивает его замороженной версией обучаемой политики. Сначала модель видит исходный контекст, который был доступен агенту во время решения. Затем в контекст добавляют финальное наблюдение — например, результат покупки или состояние виртуального дома.

В обоих случаях система оценивает то же выполненное действие через принудительную подстановку токенов (teacher forcing), а не генерирует новую ветку поведения. Поэтому метод добавляет вычисление вероятностей, но не запускает дополнительные авторегрессионные прогоны среды.

Отношение двух оценок показывает, насколько знание результата изменило правдоподобие действия. Если шаг выглядит уместнее после добавления финала, его вес растёт. RELACE нормализует веса внутри траектории и ограничивает крайние значения, чтобы одно действие не определяло всё обновление.

Полученным весом метод корректирует будущую награду шага, но не меняет награду среды. Затем он слегка сглаживает сигнал между соседними действиями и сравнивает шаги из совпадающих наблюдаемых состояний. Для успешных траекторий отрицательные локальные поправки отбрасываются, чтобы шум небольшой группы не подавлял уже сработавшее поведение.

Локальную оценку RELACE складывает с общей оценкой траектории из GRPO. Первая помогает различать действия внутри эпизода, вторая сохраняет предпочтение успешных прогонов. Авторы подчёркивают, что полученный вес измеряет ретроспективную связь с результатом, а не доказывает причинный вклад действия.

Когда RELACE меняет план обучения агента

Метод проверяли на ALFWorld и WebShop с Qwen2.5-1.5B-Instruct и Qwen2.5-7B-Instruct. Сравнение охватывает GRPO, GiGPO, HCAPO, GraphGPO и методы с отдельным критиком. Это две интерактивные среды с редкой итоговой наградой, а не общий тест рассуждений или работы с произвольными внешними API.

На меньшей модели RELACE довёл долю полностью выполненных заданий до 96,35% в ALFWorld и до 79,43% в WebShop. В ALFWorld результат выше GiGPO на 5,47 процентного пункта. На большей версии Qwen2.5 преимущество над GiGPO и GraphGPO сохранилось в обеих средах.

Сильнее всего работа касается команд, которые уже обучают многошаговую политику через GRPO или GiGPO и получают награду только в конце задачи. RELACE можно рассматривать как замену расчёта преимуществ: архитектура агента и награда среды остаются прежними, а отдельные модели награды или ценности не требуются.

Экономия на дополнительных моделях не означает бесплатное обучение. В одном замере на WebShop ретроспективная оценка занимала в среднем 6,85 секунды, или 7,97% полного зарегистрированного времени итерации. Работа не сопоставляет полный вычислительный бюджет RELACE с бюджетом всех альтернатив, поэтому обещать снижение общей стоимости пока рано.

Вторая практическая граница — группировка состояний. RELACE сравнивает действия по наблюдаемому представлению среды, хотя одинаковое наблюдение не всегда означает одинаковое скрытое состояние. Метод лучше подходит агентам, у которых среда возвращает достаточно устойчивые и сопоставимые состояния; для свободного диалога или плохо структурированных интерфейсов сначала придётся определить, какие шаги действительно можно сравнивать.

Сводная таблица объединяет результаты RELACE с опубликованными конфигурациями базовых методов, тогда как наиболее прямое сравнение динамики обучения проведено с GiGPO на общих контрольных точках. Поэтому разумный следующий шаг — пилот на собственных трассах с замером качества, памяти и времени итерации, а не немедленная замена действующей схемы обучения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу