Журнал · Rit.work

SpecQuant ускоряет локальный Qwen2.5 квантованными копиями одной модели

SpecQuant выбирает точность модели по сложности запроса и ускоряет локальную генерацию в среднем на 38,4% без переобучения отдельной черновой модели.

Rit.work
Студия разработки
21 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Локальный запуск Qwen2.5-7B удалось ускорить без переобучения и заметной потери точности. В нерецензированном препринте VIT все числа получены самими авторами: средняя задержка генерации снизилась на 38,4%. Такой подход позволяет добавить спекулятивное декодирование, не обучая отдельную черновую модель под основную.

SpecQuant берёт исходную модель с весами FP16 и после обучения создаёт из неё варианты INT4 и FP8. Квантование переводит веса в менее точный формат, чтобы сократить вычисления. Маршрутизатор оценивает длину запроса, сложность синтаксиса и плотность имён и терминов: простые запросы направляет в INT4, средние — в FP8, а сложные обрабатывает исходная FP16.

Облегчённый вариант генерирует блок токенов, после чего полная модель проверяет их параллельно. Совпавшие токены принимаются сразу, а при расхождении FP16 исправляет последовательность. Поскольку все варианты получены из одной основы, доля принятых токенов составила от 57,9 до 66,1% — этого хватило, чтобы ускорить генерацию без изменения архитектуры.

На MMLU, AlpacaEval и GSM8K задержка снизилась на 35,2–42,6%, а точность — лишь на 0,1–0,2 процентного пункта относительно обычного последовательного декодирования. Через INT4 или FP8 прошли 80% тестовых запросов; остальные маршрутизатор передал FP16.

Проверка охватила одну модель — Qwen/Qwen2.5-7B-Instruct — и три типа задач: фактические знания, выполнение инструкций и математику. В описании замеров не указана конфигурация оборудования, поэтому результат стоит считать ориентиром для собственного теста, а не готовым расчётом производительности конкретного устройства.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу