Журнал · Rit.work

Маленькие модели выдают уверенность за знание

Расхождение между несколькими ответами помогает передавать сложные запросы от маленькой языковой модели более сильной, но требует больше вычислений.

Rit.work
Студия разработки
21 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Маленькие языковые модели можно заставить реже ошибаться, если вовремя передавать сложные запросы более сильной модели. В препринте, который не прошёл рецензирование и содержит замеры самого автора, такая маршрутизация повысила точность на отдельных задачах на 50 процентных пунктов. Экономии вычислений метод не даёт: он помогает тратить их на запросы, с которыми первая модель не справляется.

Обычный сигнал уверенности здесь не сработал. Токенная энтропия показывает, насколько широко модель распределяет вероятность между вариантами следующего токена. В 91% сочетаний модели и набора задач она оставалась почти нулевой и для правильных, и для ошибочных ответов: маленькая модель столь же уверенно выбирала неверные «A», «Yes» или «No».

Полезный сигнал появился на уровне смысла ответа. Модель запускали пять раз, группировали совпадающие по смыслу результаты и измеряли расхождение между группами. Если ответы расходились сильнее порога, запрос уходил более крупной модели; если совпадали, система принимала самый частый вариант.

Качество второй модели оказалось важнее принадлежности к тому же семейству. Маршрутизация между разными семействами в среднем прибавила 22 процентных пункта точности, а внутри одного семейства — 6,8. Но схема работает не всегда: Gemma3-1B повторяла одни и те же неверные ответы, поэтому расхождение между попытками не возникало и переключение не срабатывало.

Метод проверяли на семи парах моделей из семейств Qwen, Llama, SmolLM и Gemma с более крупными экспертами. В тест вошли BoolQ, HellaSwag, ARC-Challenge, ARC-Easy и WinoGrande; на каждое сочетание пришлось от 20 до 50 примеров. Все запуски выполняли без квантования на компьютере с Apple Silicon, поэтому результаты описывают локальный сценарий, но небольшие различия на таком масштабе нельзя считать подтверждёнными.

Для архитектуры продукта вывод узкий: токенную энтропию маленькой модели не стоит использовать как единственный переключатель. Несколько независимых ответов дают более полезный сигнал, однако всегда расходуют больше токенов и иногда вызывают вторую модель. Такая каскадная схема подходит там, где точность важнее минимальной стоимости каждого запроса.

Источники

Иллюстрация: рисунок из статьи «Do small language models know what they don't know?», Prashant Mudgal, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу