Журнал · Rit.work

GraphOPD ищет решающие шаги агента по связям в траектории

GraphOPD распределяет обучение LLM-агента по зависимостям между действиями и обходит методы, которые ориентируются только на расхождение с учителем.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

При дообучении LLM-агента полезнее исправлять шаги, от которых зависят дальнейшие действия, а не шаги с максимальным расхождением между учеником и учителем. Команда University of Science and Technology of China, Xiaohongshu и HKUST-GZ предложила GraphOPD и получила преимущество до 5,8 процентного пункта над сильнейшим вариантом сравнения, хотя препринт не рецензирован, а все числа получили сами авторы. Для команд, которые обучают агентов на длинных последовательностях действий, работа ставит под сомнение привычный способ выбирать шаги для дополнительного обучения.

Большое расхождение не указывает на решающий шаг

Дистилляция на траекториях текущей политики (on-policy distillation) дополняет обучение с подкреплением подсказками от учителя. Агент получает награду только после завершения задания, поэтому учитель даёт более плотный сигнал на промежуточных шагах.

В GraphOPD учителем служит сохранённая версия самого агента перед очередным обновлением, а не внешняя более крупная модель. Обычно обучение усиливают там, где распределения ответов ученика и учителя сильнее расходятся. Это расхождение измеряют через KL-расхождение — меру различия двух распределений вероятностей.

Для длинной траектории такое правило путает отличие с важностью. Если агент рано отклонился от удачного пути, все последующие действия уже происходят в изменившемся состоянии. Учитель видит тот же контекст и может согласиться с локально разумным действием, хотя исход определила более ранняя ошибка.

Обратная ситуация возникает у взаимозаменяемых действий. Они могут сильно отличаться по формулировке или порядку, но одинаково вести к цели. Тогда KL-расхождение велико, хотя исправлять этот шаг незачем.

На ALFWorld выбор шагов с максимальным расхождением дал итоговый успех 76,3% против 83,5% у случайного выбора. Распределения KL-расхождения для успешных и неудачных шагов перекрывались на 84%: по одному этому сигналу их почти невозможно разделить.

Как граф выделяет точки, где сходятся зависимости

GraphOPD строит для каждой траектории ориентированный граф. Его вершины соответствуют шагам, а ребро связывает раннее изменение состояния с более поздним действием, которое использует изменённый объект. Например, если агент взял предмет, а затем положил его в шкаф, второй шаг зависит от первого.

Связи извлекает набор правил, который читает действия и наблюдения среды. Часто встречающиеся сущности получают меньший вес: упоминание общего объекта хуже указывает на конкретную зависимость, чем редкая сущность. Дополнительные связи отмечают возврат в прежнее состояние и сохраняют связность графа.

Затем алгоритм запускает по графу случайное блуждание и вычисляет, в каких вершинах со временем накапливается больше вероятности. Высокую оценку получают не просто последние действия, а точки, где сходятся несколько цепочек зависимостей и используются собранные ранее условия.

Структурную оценку объединяют с расхождением между учеником и учителем. Обе величины нормализуют внутри одной траектории, после чего шаги выше её среднего получают больший вес в дистилляции. Основная цель обучения GRPO при этом остаётся без структурного перевзвешивания.

Граф строится по уже записанной траектории и не требует дополнительных обращений к LLM. Это отличает GraphOPD от схем, где важность каждого шага оценивает отдельная модель. Цена такой экономии — правила извлечения связей нужно приспособить к действиям и состояниям конкретной среды.

Менять весь контур обучения пока рано

Метод проверяли на ALFWorld, WebShop и SearchQA, на моделях трёх размеров и против одиннадцати вариантов обучения. Эти среды охватывают бытовые действия, покупки в интернете и поиск ответов, но во всех случаях траекторию можно представить как последовательность достаточно явных действий и изменений состояния.

Проверка с повторным выполнением альтернативных действий подтвердила, что структурная оценка лучше связана с реальным влиянием шага на результат: коэффициент связи составил 0,58 против 0,34 у расхождения с учителем. Отдельные опыты на задачах по математике, программированию и естественным наукам показали, что тот же принцип переносится на агентов с инструментами.

Работа не требует заменять GRPO или учителя: GraphOPD меняет только распределение веса внутри дистилляции. Поэтому практический следующий шаг — сравнить структурное перевзвешивание с текущим правилом на одинаковых траекториях, если система уже сохраняет действия, наблюдения и изменения объектов.

Для агентов с непрозрачным состоянием вывод слабее. В статье связи извлекают правила, подготовленные для каждой среды; следующий предложенный авторами шаг — поручить разбор сырых траекторий LLM. Пока это означает новый источник ошибок и дополнительные обращения к модели, которых в опубликованных опытах GraphOPD не требовал.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу