Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Обучение с подкреплением плохо исправляет уверенность рассуждающей модели, если до обучения та почти всегда выбирает несколько высоких оценок. В препринте, который не проходил рецензирование и приводит замеры самих авторов, предварительное дообучение CalibSFT улучшило калибровку на 16 математических и общецелевых тестах. Для команд это означает, что награды за точную уверенность может быть недостаточно: сначала модели нужно показать широкий диапазон допустимых оценок.
Почему награда не выводит модель из узкого диапазона
Работа рассматривает вербализованную уверенность: модель выдаёт ответ, объяснение и численную вероятность того, что ответ верен. Такой показатель можно получить за одну генерацию, не обращаясь к внутренним представлениям модели и не запуская её многократно.
Перед обучением модели уже предпочитают определённые значения уверенности. Авторы называют это исходным распределением уверенности. У Qwen3-8B, Gemma4-E2B и OLMo3-7B менее 5% ответов получили уверенность ниже половины — причём высокие оценки встречались и у правильных, и у ошибочных решений.
Обучение с подкреплением использует ответы, которые генерирует текущая версия модели. Если та почти не выбирает низкую уверенность, такие варианты редко попадают в обучающую выборку и получают слабые обновления. Теоретический разбор показывает, что величина обновления для конкретной оценки зависит от того, насколько часто модель её выбирает.
Поэтому награда может сдвигать вероятность между несколькими привычными значениями, но не обязательно учит различать верные и неверные ответы. На Math500 и MinervaMath доля правильных решений различалась на 39,1%, а средняя уверенность — лишь на 9,7%. Модель замечала рост сложности гораздо слабее, чем падала её точность.
Это различие отражают две группы метрик. Ошибка калибровки показывает, насколько заявленная вероятность расходится с фактической долей правильных ответов. AUROC измеряет, насколько хорошо уверенность ранжирует правильные ответы выше ошибочных: одинаковая оценка для всех может выглядеть приемлемо по средней калибровке, но не помогает отбирать ответы.
Как CalibSFT формирует распределение до RL
CalibSFT добавляет контролируемое дообучение перед обучением с подкреплением. Для каждого вопроса базовая модель генерирует 50 ответов. Доля успешных попыток служит оценкой сложности вопроса, а правильность отдельного ответа показывает, заслуживает ли конкретное решение большей уверенности.
Целевая уверенность объединяет эти два сигнала с равным весом. Поэтому правильный ответ на сложный вопрос не получает автоматически максимальную оценку, а ошибочный ответ на простой вопрос — ту же оценку, что остальные попытки. В теоретической части авторы показывают, что такое смешивание сохраняет оптимальную вероятность правильного ответа для вопроса.
Одной разметки недостаточно: в исходном наборе многие цели сосредоточены на крайних значениях. CalibSFT поровну отбирает примеры из разных диапазонов уверенности. После такой подготовки обучение с подкреплением генерировало вдвое больше различных оценок на вопрос и продолжало исследовать широкий диапазон во время оптимизации.
Ошибочные ответы нужны, чтобы научить модель снижать уверенность, но копирование их рассуждений ухудшило бы основную задачу. Поэтому CalibSFT обучает численную уверенность на всех примерах, а текст рассуждения и финальный ответ — только на правильных. Целевая функция отдельно усредняет эти части, чтобы длинные объяснения не заглушали короткую оценку уверенности.
Когда команде стоит добавить отдельный этап
Подход относится к системам, где модель сама сообщает численную уверенность, а затем этот показатель управляет отказом от ответа, ручной проверкой или маршрутизацией к другой модели. Если продукт использует только итоговый текст и не принимает решений по уверенности, CalibSFT не меняет основной контур.
Основные эксперименты построены вокруг Qwen3-8B и пяти вариантов обучения с подкреплением. Половина тестов проверяет математику, другая половина — общецелевые рассуждения вне обучающего распределения; отдельно авторы проверили другие семейства моделей и форматы записи уверенности. CalibSFT снижал ошибку калибровки и улучшал ранжирование ответов, сохраняя сопоставимую точность основной задачи.
Для действующего контура это не замена функции награды, а новый этап перед ней. Его можно поставить перед разными алгоритмами, не меняя их цель и проверку правильности. Само дообучение потребовало 6,9% вычислительного бюджета RLCR в GPU-часах, хотя сбор нескольких ответов для построения целей тоже остаётся частью подготовки данных.
Практический вывод зависит от симптома. Если средняя уверенность уже близка к точности, но модель присваивает почти одинаковые оценки хорошим и плохим ответам, дальнейшая настройка награды может закрепить узкое распределение. Тогда сначала полезнее расширить набор оценок через CalibSFT, а уже затем оптимизировать калибровку и проверять, улучшилась ли способность отделять надёжные ответы от ошибок.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



