Журнал · Rit.work

CompKV связал отбор KV-блоков с восстановлением пропусков

CompKV ускоряет обработку длинного контекста: метод выбирает блоки по ожидаемой ошибке восстановления и сохраняет больше качества, чем другие варианты разреженного внимания.

Rit.work
Студия разработки
23 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Длинный контекст удалось обрабатывать быстрее, если учитывать не только важность фрагмента, но и ошибку после его приблизительного восстановления. В нерецензированном препринте, где все числа получены авторами, CompKV ускорил самовнимание до 6,85 раза относительно полного чтения контекста. Метод не требует дополнительного обучения, поэтому его можно встроить в систему вывода без переобучения модели.

При разреженном внимании система читает точно лишь часть кэша ключей и значений, а вклад остальных токенов восстанавливает приближённо. Обычные методы сначала выбирают блоки с наибольшей ожидаемой долей внимания, а затем отдельно компенсируют пропуски. CompKV вместо этого отдаёт точное чтение блокам, которые после компенсации оставили бы наибольшую ошибку.

Для оценки ошибки метод хранит средние ключи и значения, а также компактную статистику разброса внутри каждого блока. Блок с большой долей внимания можно пропустить, если его содержимое хорошо описывает среднее значение. Блок с меньшей долей внимания стоит прочитать точно, когда оценки внимания внутри него сильно различаются. Выбранные блоки обрабатываются полностью, остальные участвуют в общем результате через средние значения.

На RULER с Qwen3-8B CompKV получил среднюю точность 86%, Quest — 76,5%, а полное внимание — 91,5%. Лучший средний результат среди проверенных методов разреженного внимания сохранился также на LongBench-Pro для Llama-3.1-8B-Instruct и Qwen3-32B.

Проверка охватывала контексты до 128K токенов и запускалась на NVIDIA H100 при размере пакета один. Замер скорости относился к одному слою самовнимания в схеме, где полный KV-кэш лежит в памяти процессора, а выбранные блоки передаются на GPU. Поэтому результат показывает ускорение узкого места при длинном контексте, а не всей генерации целиком.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу