Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Модель рассуждений научили выдавать вероятности, по которым можно надёжнее отделять автоматические решения от случаев для проверки человеком. В препринте Zhimin Gao и Pichao Wang, который не прошёл рецензирование, авторы приводят собственные замеры: на GSM8K-Verify RLCD сохранил точность на уровне GRPO, но при допустимой ошибке 5% автоматически решил 81% примеров против 19%. Для систем с маршрутизацией по уверенности это меняет критерий выбора метода: важна не только доля верных ответов, но и способность модели распознавать собственные ошибки.
Почему оценивать надо каждое рассуждение
После рассуждения модель не выбирает готовый вариант ответа, а возвращает распределение вероятностей между вариантами. Например, она может назначить одному ответу высокую вероятность, а остальную распределить между альтернативами. Именно это распределение затем используют для решения: принять ответ автоматически или передать его человеку.
RLCD оценивает распределение строго правильным правилом. Такое правило даёт модели наибольшую ожидаемую награду, когда заявленная вероятность совпадает с реальной частотой исхода. В работе использовали оценку Брайера: уверенная ошибка штрафуется сильнее осторожной, а честная неопределённость выгоднее случайной самоуверенности.
Ключевое различие связано с тем, что именно получает оценку. Если сначала получить несколько рассуждений, усреднить их ответы и оценить смесь, награда распадается на качество отдельных ответов и премию за расхождение между ними. Модель может увеличить вторую часть, если разные рассуждения приходят к случайно разным выводам, даже когда такое разнообразие ничем не обосновано.
RLVR с наградой «верно или неверно» представляет другой крайний случай той же конструкции: премии за разнообразие нет, поэтому модель стремится выбрать самый вероятный ответ и становится чрезмерно уверенной. RLCD вместо этого оценивает распределение после каждого отдельного рассуждения. Лучшее рассуждение всё ещё помогает вычислить ответ, но само несогласие между попытками больше не приносит награду.
Совместное обучение ломает и уверенность, и рассуждение
Прямое обучение всей модели одной наградой оказалось нестабильным. Сначала модель замечает, что после пустого рассуждения проще дать осторожное распределение, чем правильно скорректировать уверенность после длинной цепочки. Примерно за 100 шагов она перестаёт рассуждать и оставляет только маркер ответа.
Ограничение отклонения от исходной модели сохраняет формат рассуждения, но не решает вторую проблему. Градиент, который меняет выбор рассуждений, оказался в 7–12 раз больше градиента, обучающего распределение ответов. Шумный сигнал начинает определять размер обновлений, пока сама оценка уверенности ещё работает плохо.
Поэтому обучение разделили. На первом этапе модель генерирует собственные рассуждения, но обновляет только распределение ответа после них. На втором этапе это уже откалиброванное распределение превращают в награду для рассуждений. Вес градиента политики уменьшают, а ограничение на отклонение удерживает модель рядом с состоянием после первого этапа.
Разделение важно не только для устойчивости. Если на втором этапе вернуть обычную награду за правильность, модель снова завышает уверенность: правильные траектории усиливаются независимо от качества вероятностей. Правило оценки должно оставаться тем же на обоих этапах.
Когда работа меняет план разработки
На MMLU-Pro RLCD прибавил 5,3 процентного пункта к точности относительно обучения с учителем. При допустимой ошибке 20% он позволил автоматически обработать 28% заданий, тогда как сравниваемые методы обучения рассуждений не дали пригодного для такого порога покрытия. Температурная калибровка не устранила разрыв: она меняет общий уровень уверенности, но не учит ставить верные ответы выше ошибочных.
Практический вывод относится прежде всего к продуктам, где уверенность управляет маршрутом: проверкой транзакции, допуском результата в процесс или передачей сложного случая специалисту. Для такого сценария недостаточно сравнивать точность и среднюю калибровку. Нужна кривая «риск — покрытие», которая показывает, какую долю запросов система обработает при заданной частоте ошибок.
Первым кандидатом для прототипа выглядит этап калибровки после рассуждения: он дал основную часть улучшения на обеих задачах. Усиливать сами рассуждения стоит там, где дополнительное вычисление действительно меняет ответ. На GSM8K-Verify второй этап помог, а на задаче, где результат сильнее зависел от знаний модели, его эффект оказался нейтральным.
Проверка охватывала Qwen3-1.7B на MMLU-Pro и созданной авторами задаче GSM8K-Verify, результаты повторяли в нескольких запусках. Отдельный опыт на ChaosNLI показал другую границу: когда неопределённость вызвана разногласиями разметчиков, рассуждение не может её устранить. RLCD в таком случае отключал рассуждение и работал на уровне прямого обучения по меткам.
Работа не даёт оснований заменять GRPO во всех контурах обучения. Но если продукт автоматизирует решения по порогу уверенности, план эксперимента стоит изменить: читать полное распределение после рассуждения, обучать его правильной оценкой и лишь затем проверять, даёт ли усиление рассуждений дополнительную пользу.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



