Журнал · Rit.work

Dual-QK совмещает 2-битный KV-кэш и прореживание каналов

Dual-QK сокращает память и чтение KV-кэша, сохраняя возможность динамически пропускать каналы при обработке длинного контекста.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

KV-кэш научились сжимать до двух бит и одновременно пропускать часть каналов ключей при чтении. Поскольку препринт не рецензирован и числа получили сами авторы, результат предварительный: в лучшем замере декодирование ускорилось в 3,75 раза. Это позволяет обслуживать длинный контекст на одном GPU без выбора между сжатием кэша и разреженным вниманием.

KV-кэш хранит ключи и значения для уже обработанных токенов, чтобы модель не вычисляла их заново. Обычные преобразования выравнивают значения ключей для точного сжатия, но заодно распределяют вклад запроса по каналам: становится сложнее понять, какие из них можно не читать. Dual-QK применяет к запросам и ключам разные, взаимно компенсирующие преобразования. Они сохраняют исходное скалярное произведение, при этом выравнивают ключи и концентрируют запрос в нескольких значимых каналах.

Ключи хранятся в формате INT2, но самый чувствительный канал остаётся в BF16. Для каждого запроса система заново выбирает каналы, которые сильнее влияют на результат. Относительное позиционное кодирование внутри блоков не даёт распределению ключей слишком далеко уйти от данных, на которых настраивали преобразования.

При прореживании 40% каналов Dual-QK обошёл OSCAR по точности на большинстве задач. На контексте 128K метод сжал KV-кэш в 6,8 раза и сократил расчётный объём чтения в 8,3 раза относительно непрореженного BF16. Последняя величина рассчитана по формату хранения, а не измерена как трафик памяти.

Метод проверили на моделях семейств Llama, Qwen и Ministral: на задачах по программированию, математике, рассуждению и поиску факта в длинном контексте. Реализация на SGLang достигла максимального ускорения на Qwen3-4B-Thinking-2507 при входе 90K и одном запросе в пакете. Выигрыш зависит от того, насколько чтение KV-кэша ограничивает декодирование; при коротком контексте расходы на выбор каналов могут съесть часть экономии.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу