Журнал · Rit.work

Уверенность LLM не улучшила выбор между памятью модели и поиском

В задачах извлечения ответов поиск по документам почти достиг предельного результата, а уверенность LLM не помогла выбирать режим ответа или данные для дальнейшего обучения.

Rit.work
Студия разработки
18 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Внутренняя уверенность LLM не помогла решать, когда доверять памяти модели, а когда искать ответ в документах. В препринте KISTI и UST, который не рецензировали и где приведены собственные замеры авторов, поиск вернул 92–99,8% лучшего результата, достижимого при идеальном выборе режима для каждого вопроса. В такой системе отдельный механизм выбора почти не получает пространства для улучшения.

Уверенность считали как среднюю вероятность токенов в сгенерированном ответе с поправкой на его длину. Этот сигнал применили двумя способами: отбирали вопросы для дальнейшего дообучения на ответах системы с поиском и выбирали между ответом из параметров модели, поиском и отказом от ответа. Критерии успеха зафиксировали до запуска опытов.

Отбор вопросов не прошёл заданные критерии ни в одной из четырёх модельных семейств, а пилотный выбор режима на LLaMA уступил постоянному поиску. Обычный пересчёт шкалы уверенности не помог: он меняет значения, но сохраняет порядок вопросов от самых уверенных к самым сомнительным. Изменение температуры на уровне токенов могло переставить вопросы, однако улучшало разделение правильных и ошибочных ответов непоследовательно. На Gemma удаление уверенности из составного показателя превратило неудачный отбор в успешный по обоим заранее заданным критериям.

Работу проверяли на LLaMA-3.1, Qwen-2.5, Gemma-2 и Mistral размером 7–9 млрд параметров, на корпусах SciTech и WikiGen. Всего сравнение режимов охватило 2860 вопросов, созданных из фрагментов, которые уже содержали ответы: такая постановка изначально благоприятна для поиска. Выбор режима отдельно испытывали только на LLaMA, а из пяти сочетаний модели и корпуса полноценное дообучение сохранилось в трёх. Вывод поэтому относится к извлечению ответов из доступных документов, где поиск уже близок к потолку, а не к задачам без надёжного источника.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу