Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
KV-кэш научились сжимать до двух бит и одновременно пропускать часть каналов ключей при чтении. Поскольку препринт не рецензирован и числа получили сами авторы, результат предварительный: в лучшем замере декодирование ускорилось в 3,75 раза. Это позволяет обслуживать длинный контекст на одном GPU без выбора между сжатием кэша и разреженным вниманием.
KV-кэш хранит ключи и значения для уже обработанных токенов, чтобы модель не вычисляла их заново. Обычные преобразования выравнивают значения ключей для точного сжатия, но заодно распределяют вклад запроса по каналам: становится сложнее понять, какие из них можно не читать. Dual-QK применяет к запросам и ключам разные, взаимно компенсирующие преобразования. Они сохраняют исходное скалярное произведение, при этом выравнивают ключи и концентрируют запрос в нескольких значимых каналах.
Ключи хранятся в формате INT2, но самый чувствительный канал остаётся в BF16. Для каждого запроса система заново выбирает каналы, которые сильнее влияют на результат. Относительное позиционное кодирование внутри блоков не даёт распределению ключей слишком далеко уйти от данных, на которых настраивали преобразования.
При прореживании 40% каналов Dual-QK обошёл OSCAR по точности на большинстве задач. На контексте 128K метод сжал KV-кэш в 6,8 раза и сократил расчётный объём чтения в 8,3 раза относительно непрореженного BF16. Последняя величина рассчитана по формату хранения, а не измерена как трафик памяти.
Метод проверили на моделях семейств Llama, Qwen и Ministral: на задачах по программированию, математике, рассуждению и поиску факта в длинном контексте. Реализация на SGLang достигла максимального ускорения на Qwen3-4B-Thinking-2507 при входе 90K и одном запросе в пакете. Выигрыш зависит от того, насколько чтение KV-кэша ограничивает декодирование; при коротком контексте расходы на выбор каналов могут съесть часть экономии.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



