Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
У рассуждающей модели встроили оценку уверенности, которая точнее отделяет верные ответы от ошибок. Команда University of Science and Technology of China, Alibaba и National University of Singapore назвала метод CREDO; в препринте, который не прошёл рецензирование и содержит замеры самих авторов, на задачах по коду он дал 932 рабочих порога отказа от ответа против 10 у DCPO. Для команд со своим контуром обучения это способ заменить нестабильную текстовую самооценку сигналом, который можно обучать напрямую.
Текстовая уверенность теряет значения и градиент
Обучение с подкреплением по проверяемой награде (RLVR) хорошо подходит для математики и кода: проверяющая программа определяет, верен ли итоговый ответ, а модель получает соответствующую награду. Но такая награда не учит оценивать вероятность ошибки. Модель может отвечать точнее и одновременно оставаться чрезмерно уверенной.
Предыдущие методы, включая RLCR и DCPO, просят модель дописать после решения число уверенности. Например, она генерирует текстовый ответ, затем выбирает текстовое представление вероятности, а функция награды сравнивает его с результатом проверки.
Здесь возникают две связанные проблемы. Число выбирается случайно, поэтому одинаковое состояние модели может дать разные оценки. Кроме того, выбор текстового токена разрывает прямой путь градиента: ошибка калибровки возвращается через общую награду, а не обучает само значение уверенности.
На практике оценки также сжимаются до нескольких популярных значений. Верные и ошибочные ответы получают одинаковые числа, поэтому системе трудно выбрать порог, ниже которого задачу стоит передать человеку, другой модели или дополнительной проверке. Изменение формулы награды не устраняет источник проблемы, пока уверенность остаётся сгенерированным текстом.
Два токена превращают уверенность в обучаемое число
CREDO оставляет в словаре два служебных токена, H и L. После ответа и краткого разбора собственной уверенности модель доходит до специальной позиции. Метод берёт вероятности этих токенов и вычисляет P(H) / (P(H) + P(L)). Получается непрерывное и детерминированное число: для одного состояния модели оно не зависит от случайного выбора текста.
Это число обучают обычной регрессией с квадратичной ошибкой. Цель сочетает результат конкретной попытки с долей правильных ответов в группе попыток по той же задаче. Групповая часть сглаживает бинарный сигнал, а градиент напрямую меняет относительные вероятности H и L.
Проверяющая программа по-прежнему отвечает за правильность решения, поэтому CREDO не заменяет основную петлю RLVR. Метод разделяет роли: градиент политики обучает текст ответа, а регрессия — оценку уверенности. Отдельная выходная головка модели не нужна, но тренировочный код должен сохранить вероятности двух токенов и добавить к общей функции потерь ошибку калибровки.
Оценка уверенности также влияет на обучение ответа. Если модель была уверена и ошиблась либо сомневалась и решила задачу правильно, CREDO повышает вес такой попытки внутри группы. Уже обученный измеритель уверенности тем самым подсказывает, на каких неожиданных исходах модель должна учиться сильнее.
Основные сравнения провели на Qwen3-8B. Модель обучали отдельно на математике и коде, а затем проверяли внутри и за пределами обучающих наборов рядом с GRPO, RLCR и DCPO. Такой масштаб показывает работу метода в задачах с автоматически проверяемым ответом, но не перенос результата на открытый диалог или закрытые модели, доступные только через API.
Менять стоит тренировочный контур, а не архитектуру продукта
Калибровку оценивали не только по близости заявленной уверенности к реальной точности. Исследователи также измеряли, как растёт доля ошибок, когда система постепенно отвечает на всё больше задач. Чем меньше площадь под этой кривой риска и охвата, тем надёжнее модель оставляет себе наиболее уверенные ответы.
На математике CREDO получил 2,62% против 4,98% у ближайшего DCPO. На коде результат составил 16,80% против 21,26%. Непрерывная оценка дала системе более точное управление отказами, тогда как текстовые методы могли переключаться лишь между немногочисленными значениями уверенности.
Работа меняет планы команд, которые сами дообучают рассуждающую модель и используют уверенность для маршрутизации, повторной проверки или отказа от ответа. Вместо ещё одной настройки награды для текстового числа имеет смысл зарезервировать пару токенов, добавить специальную позицию в формат вывода и обучать их относительную вероятность напрямую.
Переход не требует менять проверяющую программу или вводить отдельную модель-оценщик. Зато он требует доступа к распределению вероятностей и градиентам во время обучения. Поэтому CREDO относится прежде всего к устройству тренировочной петли; продуктовый контур сможет использовать её результат как обычный числовой порог.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



