Журнал · Rit.work

Уверенность мультимодальной LLM зависит от длины ответа

Токенные оценки лучше выявляют ошибки в коротких ответах, команда UNKNOWN — в предложениях, а сравнение смысла нескольких ответов — в длинном тексте.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Для коротких, средних и развёрнутых ответов мультимодальной LLM нужны разные способы определять, когда она ошибается. В нерецензированном препринте Toyota Motor Europe и University of Oxford, где все числа получили сами авторы, токенная энтропия победила на коротких ответах, команда UNKNOWN — на ответах длиной в предложение, а сравнение смыслов — на развёрнутых. Один общий порог уверенности для всех режимов будет пропускать разные типы галлюцинаций.

Работа сравнивает три семейства методов, которым не нужно дополнительное обучение. Токенные методы измеряют разброс вероятностей следующего токена и требуют доступа к внутренним данным модели. Вербализованные методы просят модель назвать уверенность или ответить UNKNOWN, а смысловые генерируют несколько ответов и группируют их по значению с помощью отдельной модели логического следования.

На коротких заданиях максимальная токенная энтропия достигла AUROC 0,76: этот показатель отражает, насколько хорошо метод ставит ошибочные ответы выше верных по неопределённости. Для оценки потребовалось два прохода модели против 11 у смысловых методов. На ответах длиной в предложение команда UNKNOWN показала AUROC 0,67, а на длинных ответах смысловые методы достигли 0,73 против 0,60 у токенных.

Методы проверили на восьми моделях семейств InternVL и QwenVL двух поколений и на пяти наборах заданий с вариантами ответа, коротким свободным ответом, предложением и развёрнутым текстом. В выборку вошли только малые и средние модели общего назначения, поэтому результат описывает этот масштаб и не переносится автоматически на крупные или отраслевые системы.

Даже лучший метод нельзя использовать как единственный защитный барьер. При допустимой доле ошибок 20% смысловые методы отвечали лишь на 21% длинных заданий. Для продукта оценку неопределённости стоит выбирать после фиксации формата ответа, а затем дополнять проверкой фактов, передачей человеку или маршрутизацией запроса в более сильную модель.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу