Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Локальный запуск Qwen2.5-7B удалось ускорить без переобучения и заметной потери точности. В нерецензированном препринте VIT все числа получены самими авторами: средняя задержка генерации снизилась на 38,4%. Такой подход позволяет добавить спекулятивное декодирование, не обучая отдельную черновую модель под основную.
SpecQuant берёт исходную модель с весами FP16 и после обучения создаёт из неё варианты INT4 и FP8. Квантование переводит веса в менее точный формат, чтобы сократить вычисления. Маршрутизатор оценивает длину запроса, сложность синтаксиса и плотность имён и терминов: простые запросы направляет в INT4, средние — в FP8, а сложные обрабатывает исходная FP16.
Облегчённый вариант генерирует блок токенов, после чего полная модель проверяет их параллельно. Совпавшие токены принимаются сразу, а при расхождении FP16 исправляет последовательность. Поскольку все варианты получены из одной основы, доля принятых токенов составила от 57,9 до 66,1% — этого хватило, чтобы ускорить генерацию без изменения архитектуры.
На MMLU, AlpacaEval и GSM8K задержка снизилась на 35,2–42,6%, а точность — лишь на 0,1–0,2 процентного пункта относительно обычного последовательного декодирования. Через INT4 или FP8 прошли 80% тестовых запросов; остальные маршрутизатор передал FP16.
Проверка охватила одну модель — Qwen/Qwen2.5-7B-Instruct — и три типа задач: фактические знания, выполнение инструкций и математику. В описании замеров не указана конфигурация оборудования, поэтому результат стоит считать ориентиром для собственного теста, а не готовым расчётом производительности конкретного устройства.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



