Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Длинный контекст удалось обрабатывать быстрее, если учитывать не только важность фрагмента, но и ошибку после его приблизительного восстановления. В нерецензированном препринте, где все числа получены авторами, CompKV ускорил самовнимание до 6,85 раза относительно полного чтения контекста. Метод не требует дополнительного обучения, поэтому его можно встроить в систему вывода без переобучения модели.
При разреженном внимании система читает точно лишь часть кэша ключей и значений, а вклад остальных токенов восстанавливает приближённо. Обычные методы сначала выбирают блоки с наибольшей ожидаемой долей внимания, а затем отдельно компенсируют пропуски. CompKV вместо этого отдаёт точное чтение блокам, которые после компенсации оставили бы наибольшую ошибку.
Для оценки ошибки метод хранит средние ключи и значения, а также компактную статистику разброса внутри каждого блока. Блок с большой долей внимания можно пропустить, если его содержимое хорошо описывает среднее значение. Блок с меньшей долей внимания стоит прочитать точно, когда оценки внимания внутри него сильно различаются. Выбранные блоки обрабатываются полностью, остальные участвуют в общем результате через средние значения.
На RULER с Qwen3-8B CompKV получил среднюю точность 86%, Quest — 76,5%, а полное внимание — 91,5%. Лучший средний результат среди проверенных методов разреженного внимания сохранился также на LongBench-Pro для Llama-3.1-8B-Instruct и Qwen3-32B.
Проверка охватывала контексты до 128K токенов и запускалась на NVIDIA H100 при размере пакета один. Замер скорости относился к одному слою самовнимания в схеме, где полный KV-кэш лежит в памяти процессора, а выбранные блоки передаются на GPU. Поэтому результат показывает ускорение узкого места при длинном контексте, а не всей генерации целиком.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



