Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Разные модели научились объединять в каскад, где решение о следующем вызове принимает общая шкала уверенности. Yilin Zhang и соавторы представили CAUC: хотя работа пока не рецензирована и все числа получили сами авторы, метод повысил среднюю точность на 1,9% относительно постоянного вызова сильной модели и позволил избежать примерно 47% её вызовов. Для смены модели или бюджета не требуется заново обучать отдельный роутер.
Как уверенность стала общей для разных моделей
Обычный каскад сначала вызывает дешёвую модель и передаёт сложные запросы дорогой. Проблема в том, что исходная уверенность несопоставима: одинаковая оценка у двух моделей может соответствовать разной доле правильных ответов. Один общий порог тогда пропускает ошибки одной модели и слишком часто отклоняет ответы другой.
CAUC после обучения калибрует каждую модель на отложенных размеченных примерах. Для неё подбирают один температурный коэффициент, который меняет распределение выходных оценок, но сохраняет выбранный вариант ответа. После этого уверенность приближённо означает вероятность правильного ответа и становится сопоставимой между моделями.
Порог для дешёвой модели задают по точности сильной модели на калибровочной выборке. Если оценка дешёвой модели достигает этого уровня, каскад принимает её ответ. Иначе он вызывает сильную модель. Теоретическая часть связывает такой порог с ожидаемой точностью принятых ответов; у исходных, некалиброванных оценок такой интерпретации нет.
Ранний ответ после передачи запроса не всегда выбрасывают. На калибровочной выборке CAUC проверяет, исправляет ли дешёвая модель больше ошибок сильной модели, чем создаёт новых. Если баланс положительный, система нормализует выходные оценки обеих моделей и объединяет их с весами по уверенности; иначе возвращает только ответ сильной модели.
Вариант CAUC-RF переносит тот же принцип на длинные цепочки. Он накапливает оценки уже вызванных моделей и подбирает общий порог на отдельной проверочной выборке под заданный вычислительный бюджет. Это позволяет менять рабочую точку без обучения классификатора, который заранее выбирает модель для запроса.
Экономия получилась без потери точности
На основной языковой паре Ministral-3-8B и Gemma-4-26B средняя точность CAUC по задачам с вариантами ответа выросла с 69,12 до 70,43%. Средняя условная стоимость снизилась с 26 до 21,73 единицы, рассчитанной по числу миллиардов параметров вызванных моделей. В опытах с классификацией изображений вычислительные затраты сокращались до 57% при сохранении или улучшении качества.
Языковую часть проверяли на MMLU, LogiQA, MathQA, MedMCQA, PIQA и SocialIQA. Сравнение включало обучаемые роутеры, каскады по необработанной уверенности, объединение моделей и постоянный вызов сильной модели. Все политики работали с одинаковыми примерами и заранее сохранёнными выходами моделей.
Для изображений использовали Caltech256, ImageNet и iWildCam, включая данные из исходного и изменённого распределения. Качество считали по доле правильных ответов или макроусреднённой F1-мере, а затраты — по числу операций с плавающей точкой.
Эти результаты описывают классификацию и вопросы с фиксированными вариантами ответа. В языковых опытах стоимость отражает размер вызванных моделей, а не цену API, задержку или расход токенов. Поэтому производственную экономику придётся пересчитать на собственных тарифах и профиле запросов.
Когда CAUC может заменить обучаемый роутер
Работа меняет планы команд, у которых состав моделей или бюджет регулярно меняется. Вместо нового набора меток для роутера достаточно откалибровать добавленную модель, обновить статистику на размеченной выборке и заново выбрать порог. Базовые модели при этом переобучать не нужно.
Подход особенно уместен, когда дешёвая модель уже уверенно закрывает заметную часть запросов, а дорогая служит страховкой. Если первая модель слаба, каскад чаще оплачивает оба вызова: сначала дешёвый, затем дорогой. Опыты с изображениями показывают именно такую зависимость между качеством ранней модели и итоговыми затратами.
CAUC требует получить оценки всех вариантов ответа, а не только готовый текст. Метод поэтому напрямую подходит классификаторам, задачам с выбором ответа и API, которые возвращают оценки кандидатов. Работа не устанавливает, что та же схема сохранит результат при свободной генерации длинного текста.
Добавлять модели в цепочку без проверки тоже невыгодно. В длинном каскаде новые ступени сначала снижали затраты, затем переставали перехватывать достаточно запросов и лишь добавляли вычисления. Практический вывод — калибровать модели независимо, но состав и порядок каскада выбирать по собственной проверочной выборке.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



