Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи из Ant Group, Alibaba Group и Universität Hamburg проверили, от чего зависит качество удаления токенов из KV-кэша во время генерации. В препринте, который не проходил рецензирования, авторы измерили, что сохраняющие порядок оценки дают сходный результат, а меняющие его варианты заметно уступают. Работа важна командам, которые сокращают память и задержку LLM с длинным контекстом.
Что сделали
KV-кэш хранит ключи и значения механизма внимания для уже обработанных токенов, чтобы модель не вычисляла их заново на каждом шаге. При ограниченном бюджете часть записей приходится удалять без возможности восстановления. Обычно методы различаются функцией оценки важности токенов, но авторы отдельно исследовали, как эти оценки объединяются между слоями модели и шагами декодирования.
В InertiaKV используется экспоненциальное скользящее среднее: новые оценки дополняют накопленное состояние, а не полностью заменяют его. Такое сглаживание создаёт инерцию порядка токенов. В вариантах с нормой значений и энтропией порядок почти сохранялся, поэтому выбранные для хранения наборы оставались сходными. KeyDiff, норма ключей, давность и обучаемая функция сильнее переставляли токены и показывали худшее качество.
На основе этого наблюдения авторы сделали InertiaKV-Lazy, где оценки пересчитываются периодически. По их замерам, пропускная способность декодирования выросла в 1,34–1,46 раза относительно InertiaKV с обновлением на каждом шаге.
Что это значит
При проектировании сжатия KV-кэша функцию оценки и правило накопления стоит проверять как два независимых решения. Более сложная оценка не даст преимущества, если она сохраняет тот же порядок токенов, а агрегация сглаживает различия. Периодический пересчёт может сократить вычисления, если порядок остаётся стабильным на конкретной модели и нагрузке.
Ограничения. Авторы проверяли сжатие на 90% на шести моделях с открытыми весами масштаба от 7B до 70B и англоязычных LongBench, LongBench-v2 и RULER. Работа не показывает устойчивость в многоходовых диалогах и сценариях с коротким запросом и длинной генерацией; метод также не уменьшает пиковую память предварительной обработки. В реализации один коэффициент одновременно задаёт память между шагами и вес слоёв, поэтому проведённое сравнение не позволяет отделить влияние временной агрегации от послойного взвешивания.
Источники
- What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation
Иллюстрация: рисунок из статьи «What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation», Bo Zeng, Yu Zhao, Yefeng Liu и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



