Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Промежуточные шаги рассуждения научились оценивать с учётом того, исправила ли модель прежнюю ошибку и к какому ответу пришла в конце. Команда Southeast University назвала подход Reasoning State Propagation, сокращённо RSP: в лучевом поиске он повысил среднюю точность на 5,6 пункта относительно Qwen2.5-Math-PRM; поскольку препринт не рецензирован, все числа в нём получили сами авторы. Метод позволяет совмещать ограниченную разметку шагов с большим набором итоговых меток, если правильность ответа можно проверить автоматически.
Как итоговый ответ обучает промежуточные переходы
Модель оценки процесса (process reward model, PRM) присваивает баллы отдельным шагам рассуждения. Такой оценщик помогает отбрасывать неудачные продолжения во время поиска, выбирать лучший ответ из нескольких вариантов и распределять награду при обучении с подкреплением.
Обычный оценщик рассматривает каждый префикс рассуждения как отдельный объект: после очередного шага он решает, остаётся ли решение верным. Связь между соседними состояниями явно не задаётся, поэтому правильность конечного ответа не даёт прямого обучающего сигнала более ранним шагам.
RSP хранит для каждого префикса одно из двух состояний: рассуждение либо корректно, либо содержит неразрешённую ошибку. На каждом шаге оценщик предсказывает вероятность сломать корректное состояние и вероятность исправить некорректное. Затем он последовательно переносит распределение вероятностей по всей цепочке.
Разметка процесса по-прежнему указывает, какие промежуточные состояния корректны. Итоговая метка задаёт состояние всей цепочки, а ошибка обучения проходит назад через переходы между шагами. Поэтому траектория, для которой известен только конечный результат, всё равно обучает оценщик находить места возможной поломки и восстановления.
Это отличается от схем, где первая найденная ошибка делает все следующие шаги некорректными. RSP допускает, что модель заметит ошибку, заменит неверное рассуждение и вернётся к рабочему решению. Обратная ситуация тоже возможна: правильный ответ не означает, что каждый предшествующий шаг был корректен.
Исправление ошибки влияет и на поиск, и на обучение
В обучении с подкреплением RSP превысил среднюю точность варианта с Qwen2.5-Math-PRM на 2,1 пункта. На AIME разрыв достиг 7,8 пункта. В среднем RSP оказался единственным проверенным вариантом с процессной наградой, который заметно обошёл GRPO, использующий награду за конечный ответ.
Проверка отдельных частей метода показывает, что результат связан не только с дополнительными обучающими данными. Запрет перехода из ошибочного состояния обратно в корректное снизил точность лучевого поиска на 3,3 пункта. Если итоговой метке не позволяли обучать ранние переходы, падение достигало 6,7 пункта.
Для основного варианта взяли Qwen3-4B. Процессную часть обучающего набора составила пятая часть PRM800K с человеческой разметкой шагов, а итоговые метки пришли из отфильтрованного AceMath-RM; в пакетах на один пример с разметкой процесса приходились три примера только с конечным результатом.
Метод проверяли на выборе готового ответа, лучевом поиске, ProcessBench и обучении с подкреплением на математических задачах. Для лучевого поиска использовали MATH500 и Gaokao, а обучение с подкреплением оценивали на шести математических наборах. В сравнение вошли независимый оценщик шагов, OVM, CRM, Qwen2.5-Math-PRM и GRPO.
Менять архитектуру стоит там, где ответ можно проверить
Работа меняет планы команд, которые обучают собственный оценщик для математических агентов, генерации кода или других задач с проверяемым результатом. Вместо двух несвязанных источников данных можно построить единое обучение: редкая разметка шагов задаёт смысл промежуточных состояний, а массовые итоговые метки уточняют переходы между ними.
Практический вывод касается архитектуры оценщика. Если система уже генерирует несколько цепочек, ведёт поиск или использует процессную награду, имеет смысл сравнить независимую классификацию шагов с переносом состояния. В эксперименте особенно важны два элемента: отдельная вероятность исправления ошибки и передача градиента от конечного результата к ранним переходам.
RSP не устраняет потребность в разметке процесса. В опытах обучение только по итоговым меткам почти сохранило качество выбора готового ответа, но хуже находило ошибочные шаги на ProcessBench. Эти два вида разметки решают разные задачи: итоговые метки масштабируют обучение, а процессные удерживают локальную точность оценщика.
Границы результатов проходят по математическим рассуждениям с однозначно проверяемым ответом и моделям семейства Qwen3. Для продуктов, где качество определяет эксперт или результат проявляется после длинного бизнес-процесса, работа пока не даёт основания менять стек целиком. Она предлагает конкретный эксперимент для слоя оценки, а не замену основной модели или способ формулировать запросы.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



