Журнал · Rit.work

Probe-SD переносит внутреннюю уверенность модели в её ответы без онлайн-RL

Probe-SD извлекает оценку уверенности из скрытого состояния reasoning-модели и переносит её в ответы через дообучение с учителем, убирая отдельный оценщик из рабочего контура.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель научили сообщать уверенность, которая соответствует фактической доле верных ответов. В нерецензированном препринте с замерами самих авторов Probe-SD снизил ошибку калибровки Qwen3-14B вне обучающего распределения с 0,542 до 0,113. Команда получает оценку риска в обычном ответе модели, без отдельного оценщика и онлайн-RL в рабочем контуре.

Скрытое состояние оценивает риск, но не выбирает ответ

Калиброванная уверенность имеет прямой смысл: среди ответов с заявленной уверенностью 80% примерно восемь из десяти должны быть верными. Обычное обучение с бинарной наградой этому не учит. Угаданный правильный ответ получает ту же награду, что и уверенно обоснованный, а осторожный отказ наказывается как ошибка.

Поэтому число, которое reasoning-модель пишет в ответе, скорее отражает готовность на нём настаивать, чем вероятность оказаться правой. Простое изменение шкалы помогает на данных, где его настроили, но хуже переносится на вопросы другого типа.

Probe-SD начинает с линейного классификатора, который читает скрытое состояние между цепочкой рассуждений и финальным ответом. Его обучают отличать верные рассуждения от ошибочных. В отличие от заявленной уверенности, этот сигнал связан с фактической правильностью конкретного ответа.

На TriviaQA классификатор обучали, а на EntityQuestions, NQ-open и SimpleQA-Verified проверяли перенос. В экспериментах с Qwen3-14B и Ministral-3-8B-Reasoning-2512 ошибка ожидаемой калибровки оказалась до 38 раз ниже, чем у уверенности, написанной самой моделью. Эта метрика измеряет разрыв между заявленной вероятностью и реальной долей правильных ответов: чем она меньше, тем надёжнее пороги вроде «отправлять человеку всё ниже заданной уверенности».

Но хорошо оценить риск не значит найти правильный вариант среди нескольких генераций. При 32 попытках классификатор выбрал верный ответ в 0,778 случаев, голосование большинства — в 0,771, а теоретический выбор любого правильного варианта среди сгенерированных дал бы 0,879. Скрытое состояние подходит для оценки надёжности уже полученного рассуждения, но почти не улучшает ранжирование кандидатов.

Probe-SD оставляет классификатор за пределами рабочего контура

Отдельный классификатор требует доступа к скрытым состояниям. Его нельзя подключить к модели, которая доступна только через текстовый API, а постоянное чтение внутренних активаций усложняет инфраструктуру. Probe-SD использует классификатор только при подготовке обучающих данных.

Сначала reasoning-модель генерирует несколько цепочек рассуждений для каждого вопроса. Классификатор оценивает каждую цепочку и заменяет написанную моделью уверенность своей вероятностью. Сам ответ и основные шаги рассуждения при этом сохраняются.

Механическая замена может создать противоречие: текст говорит «ответ определённо верен», а рядом стоит низкая вероятность. Поэтому конвейер отбрасывает цепочки с несколькими несовместимыми оценками и проверяет согласованность формулировок с итоговым числом через Gemma-4-31B-it. Этот фильтр не решает задачу и не добавляет сведения о правильном ответе — он следит только за тем, чтобы текст не спорил с оценкой.

Затем базовую модель той же семьи дообучают с учителем на исправленных примерах. После этого она сама выдаёт перенесённую оценку, поэтому при эксплуатации не нужны классификатор, модель-оценщик или повторная генерация. Онлайн-RL с отдельной функцией награды также не требуется.

Контрольные варианты заменяли уверенность частотой правильных ответов на вопрос или долей одинаковых ответов среди генераций. Они использовали тот же конвейер, поэтому сравнение отделяет качество внутреннего сигнала от эффекта обычного дообучения на собственных ответах.

Когда результат меняет архитектурный план

Работа даёт практический путь для систем, где модель должна не только отвечать, но и управлять следующим шагом процесса. Калиброванную вероятность можно использовать для передачи случая оператору, выбора более дорогой модели или взвешенного голосования. Для этого полезнее честная оценка риска, чем ещё один слабо отличающийся кандидат.

Если команда работает с открытыми весами, Probe-SD предлагает заменить онлайн-RL на офлайн-конвейер: получить скрытые состояния, обучить простой классификатор, разметить им собственные ответы модели и провести дообучение с учителем. Это сокращает рабочий контур, хотя подготовка данных всё равно требует доступа к внутренним активациям и отдельной настройки классификатора для каждой модели.

Для продукта на закрытом текстовом API вывод уже: повторить обучение по этой схеме нельзя без доступа к скрытым состояниям. Результат также не поддерживает идею использовать уверенность как универсальный фильтр галлюцинаций или средство выбора лучшего ответа — эксперимент показывает, что это отдельная задача.

Проверка охватывает две открытые reasoning-модели и фактические вопросы с короткими проверяемыми ответами. Выводы относятся к TriviaQA и трём другим наборам такого типа; работа не устанавливает тот же эффект для длинных текстов, субъективных задач и моделей большего масштаба. Для внедрения это означает, что пороги уверенности всё равно придётся проверять на данных конкретного продукта.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу