Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Внутренняя уверенность LLM не помогла решать, когда доверять памяти модели, а когда искать ответ в документах. В препринте KISTI и UST, который не рецензировали и где приведены собственные замеры авторов, поиск вернул 92–99,8% лучшего результата, достижимого при идеальном выборе режима для каждого вопроса. В такой системе отдельный механизм выбора почти не получает пространства для улучшения.
Уверенность считали как среднюю вероятность токенов в сгенерированном ответе с поправкой на его длину. Этот сигнал применили двумя способами: отбирали вопросы для дальнейшего дообучения на ответах системы с поиском и выбирали между ответом из параметров модели, поиском и отказом от ответа. Критерии успеха зафиксировали до запуска опытов.
Отбор вопросов не прошёл заданные критерии ни в одной из четырёх модельных семейств, а пилотный выбор режима на LLaMA уступил постоянному поиску. Обычный пересчёт шкалы уверенности не помог: он меняет значения, но сохраняет порядок вопросов от самых уверенных к самым сомнительным. Изменение температуры на уровне токенов могло переставить вопросы, однако улучшало разделение правильных и ошибочных ответов непоследовательно. На Gemma удаление уверенности из составного показателя превратило неудачный отбор в успешный по обоим заранее заданным критериям.
Работу проверяли на LLaMA-3.1, Qwen-2.5, Gemma-2 и Mistral размером 7–9 млрд параметров, на корпусах SciTech и WikiGen. Всего сравнение режимов охватило 2860 вопросов, созданных из фрагментов, которые уже содержали ответы: такая постановка изначально благоприятна для поиска. Выбор режима отдельно испытывали только на LLaMA, а из пяти сочетаний модели и корпуса полноценное дообучение сохранилось в трёх. Вывод поэтому относится к извлечению ответов из доступных документов, где поиск уже близок к потолку, а не к задачам без надёжного источника.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



