Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Уверенность модели нельзя считать прямой оценкой правильности: она лучше показывает, какие вопросы для модели трудны, чем какой из нескольких ответов на один вопрос верен. В работе Shanghai Jiao Tong University и Qwen Team адаптивная схема подняла точность с 78,71% до 79,54% и сократила объём сгенерированных токенов на 82,4%, однако работа не прошла рецензирование, а все числа получили её авторы. Для команд это повод разделить сигналы, по которым система выделяет вычислительный бюджет и выбирает итоговый ответ.
Уверенность отвечает на два разных вопроса
Уверенность на уровне токена (token-level certainty) вычисляют по распределению вероятностей следующего токена. Если модель явно предпочитает один вариант продолжения остальным, оценка выше; если распределяет вероятность между несколькими вариантами, ниже. Оценки отдельных токенов затем усредняют по всему ответу или по выбранному фрагменту.
Работа разделяет две задачи, которые обычно смешивают. Первая — определить, на какие вопросы модель в среднем отвечает лучше. Вторая — взять несколько рассуждений для одного вопроса и отличить правильные от неправильных.
Для первой задачи исследователи сравнивали среднюю уверенность по вопросу с долей правильных ответов. Для второй проверяли, оказывается ли правильное рассуждение выше неправильного в рейтинге уверенности. Такое разделение исключает ситуацию, когда показатель хорошо распознаёт лёгкие вопросы, но бесполезен при выборе ответа внутри одного вопроса.
Это различие не видно по итоговой точности голосования. Если большинство рассуждений приводит к одному ошибочному ответу, оно может победить даже тогда, когда единственный правильный вариант получил наивысшую уверенность. И наоборот, удачный итог голосования ещё не доказывает, что оценка уверенности правильно ранжирует отдельные рассуждения.
Проверка охватила пять моделей, включая Qwen3, GPT-OSS-20B и Gemma 4, на AIME 2024, AIME 2025 и GPQA-Diamond. Сравнивали самооценку уверенности, отрицательную энтропию, логарифм максимальной вероятности и разрыв логитов — разницу между наиболее вероятным токеном и одним из менее вероятных кандидатов. Во всех сочетаниях моделей и метрик сигнал лучше разделял вопросы по трудности, чем ответы на один вопрос по правильности.
Начало рассуждения показывает трудность, конец помогает выбрать ответ
Полезный сигнал распределён по ответу неравномерно. Уверенность в начале генерации уже показывает, насколько вопрос труден для модели. Различия между правильными и неправильными рассуждениями слабее и заметнее ближе к концу.
Исследователи проверяли это, отдельно усредняя оценки по первым и последним 1000 токенам, а также по полному рассуждению. Начальный фрагмент лучше подходил для сравнения вопросов, а конечный — для ранжирования ответов внутри одного вопроса. Заключительный сигнал сохранялся не только в строке с финальным ответом: он присутствовал и в поздней части самого рассуждения.
На этом разделении построена схема TACS. Сначала она оценивает начало нескольких ответов и выделяет больше попыток вопросам, которые выглядят трудными. Затем группирует одинаковые финальные ответы и взвешивает их голоса по уверенности в конце рассуждения.
Базовый вариант всегда генерировал по 256 ответов и выбирал итог простым большинством. TACS не пыталась заменить голосование одной «самой уверенной» цепочкой: ранний сигнал управлял числом попыток, а поздний корректировал вес голосов. Именно распределение ролей дало выигрыш по токенам без потери точности.
Средняя уверенность зависит и от формы текста. Знаки пунктуации, математические символы, цифры и поздние части разбитых на токены слов получали более высокие оценки, чем начало обычных слов. Простое исключение таких позиций не улучшало результат стабильно, поэтому фильтр токенов нельзя переносить между моделями и задачами без отдельной проверки.
Планы стоит менять для распределения бюджета, но не для проверки ответов
Работа даёт практический шаблон для систем, которые уже генерируют несколько рассуждений. Оценку из начала ответа можно использовать для динамического бюджета: быстро завершать обработку простых запросов и продолжать выборку для сложных. Это применимо к маршрутизации между моделями, повторной генерации и пакетной обработке задач с ограниченным запасом GPU.
Использовать ту же оценку как замену проверяющей модели рискованнее. У GPT-OSS-20B различение правильных и неправильных ответов на один вопрос оставалось близким к случайному при всех проверенных метриках. У Qwen и Gemma результат зависел от конкретной модели и способа расчёта, а взвешивание голосов помогало не во всех сочетаниях.
Команде, которая строит такую систему, нужны вероятности следующих токенов и возможность собирать несколько ответов на запрос. Перед внедрением стоит отдельно измерить две вещи на собственных данных: насколько ранняя уверенность предсказывает долю успешных попыток и насколько поздняя ранжирует ответы внутри одного запроса. Общая метрика точности голосования эти свойства не разделяет.
Границы выводов задаёт сам эксперимент: математические задачи и научные вопросы с проверяемым финальным ответом, пять рассуждающих моделей и четыре способа измерить уверенность. Работа показывает способ экономить вычисления в таком режиме, но не подтверждает, что уверенность сможет заменить проверку в открытых диалогах, программных агентах или задачах без однозначного эталона.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



