Журнал · Rit.work

PRO-Step обучает RAG на ошибках отдельных шагов, а не только на финальном ответе

Авторы PRO-Step предлагают проверять каждый шаг агентного RAG на логическую корректность и опору на найденные документы, а затем обучать модель на предпочтительных вариантах.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

MinKeon Kim, Namjun Lee и Jaekwang Kim предложили PRO-Step — способ обучать агентный RAG на качестве отдельных поисковых и логических шагов; работа опубликована как препринт, не прошедший рецензирования. По замерам авторов, средняя F1 — мера совпадения токенов в ответе с эталоном — составила 44,1 против 42,0 у ближайшего конкурента StepSearch. Работа важна командам, которые обучают собственные модели для многошагового поиска, но пока не требует менять обычные продуктовые RAG-системы.

Что сделали

В агентном RAG модель не ограничивается одним поисковым запросом. Она рассуждает, решает, когда обратиться к поиску, получает документы, уточняет запрос и продолжает цепочку. Ошибка в начале может привести к нерелевантным документам и испортить последующие шаги, даже если итоговый ответ случайно окажется правильным.

Обычное обучение по результату оценивает только финальный ответ. PRO-Step добавляет генеративную модель оценки процесса: для каждого шага она формулирует объяснение и присваивает двоичную метку корректности. Проверяются две стороны шага: следует ли вывод из предыдущего рассуждения и подтверждается ли он найденными документами. Разметку обучающих траекторий авторы получили с помощью QwQ-32B, а отдельную модель-оценщик обучили воспроизводить такие объяснения и метки.

Затем авторы запускают поиск по дереву вариантов. Узел дерева хранит вопрос и уже выполненные шаги, а ветви соответствуют возможным продолжениям: рассуждению, новому поисковому запросу или ответу. Модель-оценщик проверяет промежуточные узлы, а качество завершённых ветвей определяется по итоговому ответу. Так система учитывает и локальную корректность шага, и способность всей ветви привести к результату.

Соседние ветви сравниваются между собой. Более качественный шаг становится предпочтительным, менее качественный — отклонённым. На этих парах обучают основную модель методом прямой оптимизации предпочтений (DPO): модель повышает вероятность выбранного продолжения относительно отклонённого, не воспроизводя содержимое найденных документов как собственный ответ.

Что показали

Авторы проверили PRO-Step на задачах с одним и несколькими переходами между фактами. Средняя доля точных совпадений ответа с эталоном, или EM, достигла 34,5 против 33,2 у StepSearch. Разница по средним EM и F1 с рядом базовых методов статистически значима, хотя преимущество сохраняется не на каждом отдельном наборе данных.

Удаление процессной модели оценки снизило среднюю F1 на 2,2 процентного пункта. По интерпретации авторов, результат связан не только с поиском удачной полной траектории: отдельная проверка шагов помогает отсеивать ветви, где неправильное рассуждение случайно приводит к верному ответу.

PRO-Step также оказался лучше варианта с обучением по готовым примерам и варианта с другой функцией оптимизации предпочтений. Это поддерживает основную конструкцию работы: оценщик нужен не как фильтр после генерации, а как средство собрать контрастные пары шагов для обучения политики.

Ограничения

Обучение проводилось на 5000 исходных вопросах из HotpotQA, MuSiQue и 2WikiMultiHopQA, а проверка — на них и на PopQA и Bamboogle. Это исследовательские наборы вопросов и ответов, а не производственные сценарии с правами доступа, изменяемыми документами, длинными диалогами и действиями во внешних системах. Поиск работал по срезу Wikipedia за 2018 год, поэтому работа не показывает поведение метода на корпоративных базах знаний или постоянно обновляемом интернете.

Разметка шагов зависит от QwQ-32B. Авторы сопоставили её решения с Claude Opus 4.7 и получили существенное согласие, но такая проверка не устанавливает фактическую корректность каждой метки. Ошибки оценщика могут перейти в дерево поиска и затем в пары предпочтений.

Результаты Bamboogle основаны на 125 тестовых примерах, и авторы прямо отмечают широкую погрешность. Кроме того, сравниваемые методы не во всех случаях используют одинаковые базовые модели. В представленном сравнении нет замеров полной стоимости обучения, задержки поиска по дереву и расхода GPU относительно обучения только по финальному ответу. Поэтому работа не показывает, окупается ли прирост качества в конкретной инфраструктуре.

Что это значит

Для команды, которая использует готовую LLM, один поиск и генерацию ответа без собственного обучения, PRO-Step планы не меняет. Метод требует сбора траекторий, отдельного оценщика, построения дерева вариантов и обучения модели по предпочтениям. Это другой уровень инфраструктуры по сравнению с настройкой поискового индекса и подсказок.

Для команд, уже обучающих агентный RAG, работа добавляет обоснованный эксперимент в план. Вместо награды только за итоговый ответ можно раздельно проверять логическую связность шага и его опору на документы, а затем обучать модель на парах продолжений с общим контекстом. Такая схема особенно уместна, когда модель выполняет несколько поисков и должна исправляться после неудачного запроса.

Практическая проверка должна начинаться не с полного воспроизведения PRO-Step, а с журнала промежуточных действий и разметки типов ошибок. Затем процессный оценщик следует сравнить с простой наградой за итоговый ответ на собственных данных, отдельно измеряя качество, стоимость построения предпочтений и задержку. Пока работа показывает возможное направление оптимизации, а не готовое основание менять производственную архитектуру.

Источники

Иллюстрация: рисунок из статьи «PRO-Step: Step-level Process Reward Optimization for Retrieval-Augmented Generation», MinKeon Kim, Namjun Lee, Jaekwang Kim, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу