Журнал · Rit.work

PivotOPD учит LLM-агентов восстанавливаться после ключевой ошибки

PivotOPD обучает многоходовых LLM-агентов избегать ключевых ошибок и продолжать работу из состояния, которое такая ошибка уже создала.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Многоходового LLM-агента научили не только избегать ранней ключевой ошибки, но и возвращаться к решению после неё. В препринте, который не прошёл рецензирование и приводит замеры самих авторов, PivotOPD показал лучший средний результат среди 13 методов на задачах с действиями, поиском и работой в интернете. Для разработки агентов это меняет цель обучения: полезно разбирать не только правильные траектории, но и состояния, в которые модель попадает из-за собственных ошибок.

Одна ранняя ошибка меняет всю дальнейшую траекторию

Обычная дистилляция на траекториях текущей модели (on-policy distillation) работает так: ученик выполняет задачу, а более сильная модель даёт подробный обучающий сигнал для получившихся ответов. В многоходовой среде этого недостаточно, потому что неправильное действие меняет состояние среды и набор доступных следующих действий.

PivotOPD сосредоточен на поворотной ошибке — действии, после которого кратчайший путь к цели становится длиннее или задача перестаёт решаться. В ALFWorld такие ошибки встретились в 59% неудачных траекторий трёх моделей Qwen3. Обычно первая из них возникала в начале работы, после чего агент продолжал тратить ходы, не возвращаясь к полезной последовательности действий.

Ошибку не всегда нужно предотвращать, чтобы спасти задачу. Если заменить поворотное действие на подсказанное символьным оракулом, доля успешных повторов достигает 59%. Если оставить ошибку и направить только следующие действия, результат почти тот же — 58%.

Стандартная дистилляция снижала общую долю неудач, но почти не исправляла траектории с поворотной ошибкой. Причина в том, что ученик редко сам выбирает действие, которое выводит его из созданного им состояния. Значит, правильное продолжение не попадает в обучающие примеры и не получает полезного сигнала.

Как модель учат предотвращать ошибку и выходить из неё

PivotOPD сначала собирает траектории ученика вместе с итогом задачи. Модель-учитель читает каждую траекторию, выбирает места, где решение могло свернуть не туда, и называет эталонное действие. Если оно отличается от действия ученика, ход считают поворотным.

Дальше обучение расходится на две ветви. Первая повышает вероятность эталонного действия в момент ошибки. Для этого замороженная копия ученика получает подсказку с правильным действием и заново оценивает уже записанный ответ. Такой сигнал отталкивает модель от выбранной ошибки, не требуя переписывать всю траекторию.

Вторая ветвь начинается после ошибки. Учитель называет действие для восстановления, а замороженная копия ученика пишет ответ, который ведёт к нему в привычном для модели стиле рассуждения. Исходный ученик получает тот же контекст без подсказки и учится воспроизводить это продолжение.

Разница между ветвями существенна. Предотвращение переоценивает ответ, который ученик уже смог создать. Восстановление обучает на ответе, созданном с подсказкой, поэтому модель видит полезное действие, даже если сама почти никогда его не выбирает.

Следующие шаги восстановления выполняются в копии среды: она повторяет все предыдущие действия, включая ошибочное, а затем применяет новый ответ. Поэтому PivotOPD учит не абстрактному исправлению рассуждения, а поведению в состоянии, которое действительно возникло после сбоя. В одном из разборов агент взял томат вместо яйца; обученная модель отложила томат, нашла яйцо и закончила задачу, тогда как базовая продолжила работать не с тем предметом.

Когда PivotOPD меняет планы разработки агента

Метод проверяли на Qwen3-1.7B и Qwen3-8B в ALFWorld, WebShop и задачах поиска ответа, а перенос на другую модельную семью — на Nemotron-3.5 в SWE-Bench Verified. Это охватывает текстовые действия в среде, покупки, поиск сведений и исправление программ, но все эксперименты относятся к обучаемым агентам с доступом к траекториям и модели-учителю.

На ALFWorld младшая Qwen3 прибавила 5,5 процентного пункта относительно сильнейшего базового метода. В SWE-Bench Verified PivotOPD поднял долю решённых задач на 3,2 пункта, тогда как стандартная дистилляция дала 0,2 пункта. Перенос между семействами моделей показывает, что эффект связан не только с особенностями Qwen3.

Работа меняет планы команды, если агент выполняет длинные задачи, взаимодействует с изменяемой средой и после ошибки продолжает действовать в ней. В таком проекте стоит сохранять не только успешные прогоны и итоговую награду, но также состояния после неудачных действий, оценки критических ходов и варианты выхода из них.

PivotOPD требует учителя, который способен найти ошибочный ход и предложить допустимое продолжение, а для нескольких шагов восстановления — ещё и повторяемой среды. Если процесс нельзя воспроизвести или состояние после действия не сохраняется, сначала придётся построить журналирование и механизм повторного запуска. Сам метод не заменяет эту инфраструктуру.

Источники

Иллюстрация: рисунок из статьи «PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents», Yinghui He, Yapei Chang, Khushi Bhardwaj и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу