Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
WenJie Fan из Yotta Labs представил VestigeKV — политику управления KV-кэшем для Kimi Linear, описанную в препринте, который не проходил рецензирования. По замерам автора, при 128-кратном сокращении активной части кэша система извлекла все проверочные скрытые фрагменты с подключённым слоем возврата. Работа важна командам, которые рассматривают модели без позиционного кодирования для продуктов с длинным контекстом.
Что сделали
VestigeKV предназначен для архитектуры без позиционного кодирования (NoPE) с многоголовым латентным вниманием (MLA). В Kimi Linear автор обнаружил отдельную ветвь KV-кэша, которая первоначально была нужна для позиционного кодирования, а после обучения NoPE-модели стала указывать на значимость токена независимо от будущего запроса.
Политика читает 11% каждой строки кэша, ранжирует токены по этому сигналу и оставляет наиболее значимые строки в активном слое внимания. Остальные строки не удаляются: они без изменений переходят в архив на GPU. Во время генерации компактный индекс проверяет архив и возвращает строки, способные конкурировать с активными токенами.
Метод не требует переобучения, квантования, изменения весов или вычислительных ядер. При 32-кратном сокращении активного слоя автор оценил уменьшение объёма чтения на пути KV примерно в четыре раза; фактическое ускорение готового вычислительного ядра в работе не измерялось.
Что это значит
VestigeKV предлагает снижать нагрузку длинного контекста не по уже наблюдавшемуся вниманию, а по сигналу внутри самой модели. Это подходит для долговечных кэшей, которые приходится сжимать до появления запросов к сохранённым данным. Однако стандартная конфигурация держит архив на GPU, поэтому сокращает прежде всего объём чтения при внимании, а не общий расход видеопамяти. Выгрузка архива в оперативную память предусмотрена как отдельный вариант.
Ограничения. Все основные замеры проведены на одной модели Kimi Linear 48B, на извлечении скрытого фрагмента и продолжении документов с контекстом до 65 тысяч токенов. Перенос на Kimi K3 автор называет возможным, но не проверял; стандартные наборы задач для длинного контекста также не использовались. Сравнение с H2O и SnapKV проведено в режиме, где будущий запрос отсутствует при сжатии, хотя эти методы рассчитаны на наблюдавшееся внимание, поэтому результаты не доказывают общего превосходства VestigeKV. Перенос на архитектуры с RoPE замеры автора не подтверждают.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



