Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Kevin Du, Alexander Hoyle, Laura Ruis и Acyr Locatelli из ETH Zürich, MIT и Cohere исследовали, можно ли определить влияние отдельного шага рассуждения по его тексту. В препринте, который не проходил рецензирования, авторы утверждают, что обученные критики приближаются к оценочному потолку на ошибочных ответах, но остаются далеко от него на правильных. Это важно командам, которые используют цепочки рассуждений для аудита LLM или обучения моделей вознаграждения процесса.
Что сделали
Авторы определили важность шага через его преимущество: изменение вероятности получить тот же итоговый ответ после добавления этого шага. Вероятность оценивали методом Монте-Карло — многократно продолжали генерацию до и после выбранного фрагмента и сравнивали результаты. Для каждого состояния запускали по 50 продолжений, а значимыми считали устойчивые изменения вероятности более чем на 0,1.
Основной набор включал математические задачи из AIME, AMC, MATH500 и GSM8K: по 180 вопросов для каждой из трёх моделей Qwen3 и по десять ответов на вопрос. Изменения внутри длинных цепочек находили алгоритмом обнаружения точек смены, чтобы не принимать случайные колебания за важные шаги.
Затем LLM-оценщикам предлагали определить значимые шаги только по тексту. Готовые модели превзошли базовый вариант, который ориентируется на частоту класса, но заметно отстали от оценочного потолка — верхней границы, заданной воспроизводимостью самих меток. Дополнительное обучение улучшило результат преимущественно для неверных ответов; в корректных решениях из текста восстанавливалась лишь малая часть доступного сигнала.
Что это значит
Читаемый фрагмент вроде самопроверки не обязательно меняет дальнейший ответ, а внешне нейтральный шаг может оказаться определяющим. Поэтому пошаговый критик подходит как эвристика для поиска возможной ошибки, но замеры авторов не поддерживают использование его оценки как надёжного объяснения поведения модели. Для моделей вознаграждения процесса это означает риск обучать систему на убедительности формулировки, а не на фактическом вкладе шага.
Ограничения. Работу проверяли в основном на математических задачах и моделях Qwen3; режим рассуждения исследовали на меньшем наборе задач и с отсечением длинных ответов. Авторы измеряли вероятность совпадения с исходным или правильным ответом, а не причинную необходимость шага во всех возможных продолжениях. Сравнение с базовой частотой и оценочным потолком также не показывает, улучшает ли такой критик обучение итоговой модели или качество продукта в реальном процессе.
Источники
Иллюстрация: рисунок из статьи «Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning», Kevin Du, Alexander Hoyle, Laura Ruis и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



