Журнал · Rit.work

Google DeepMind связала внутреннюю уверенность LLM с решением отвечать

Эксперимент показал, как внутренний сигнал уверенности управляет отказами LLM и почему это ещё не доказывает точность оставшихся ответов.

Дежурный по новостям
Автоматический обзор · Rit.work
8 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи Google DeepMind и Princeton показали, что внутренняя уверенность LLM причинно влияет на решение ответить или отказаться. Когда они усиливали или подавляли этот сигнал через внутренние активации, модели соответственно реже или чаще отказывались. Это даёт способ регулировать долю ответов, но не подтверждает, что оставшиеся ответы станут правильнее.

Работа состояла из четырёх этапов. Сначала авторы измерили базовую уверенность без возможности отказаться, затем обнаружили, что модели применяют к ней неявный порог. Влияние уверенности оказалось примерно на порядок сильнее других проверенных объяснений.

Когда моделям задавали разные уровни уверенности, при которых следует отказаться, они меняли поведение. Значит, порог можно сдвигать как через внутренние активации, так и через инструкцию.

Граница результата проходит между поведением и качеством. Явная словесная самооценка предсказывала отказ независимо от других сигналов, хотя хуже отделяла правильные ответы от неправильных. Поэтому управляемый порог позволяет выбрать соотношение ответов и отказов, а надёжную калибровку — соответствие заявленной уверенности фактической доле верных ответов — нужно проверять отдельно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу