Журнал · Rit.work

VestigeKV сокращает активную часть KV-кэша Kimi Linear

VestigeKV отбирает строки KV-кэша по внутреннему сигналу модели и уменьшает объём данных, читаемых при обработке длинного контекста.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

WenJie Fan из Yotta Labs представил VestigeKV — политику управления KV-кэшем для Kimi Linear, описанную в препринте, который не проходил рецензирования. По замерам автора, при 128-кратном сокращении активной части кэша система извлекла все проверочные скрытые фрагменты с подключённым слоем возврата. Работа важна командам, которые рассматривают модели без позиционного кодирования для продуктов с длинным контекстом.

Что сделали

VestigeKV предназначен для архитектуры без позиционного кодирования (NoPE) с многоголовым латентным вниманием (MLA). В Kimi Linear автор обнаружил отдельную ветвь KV-кэша, которая первоначально была нужна для позиционного кодирования, а после обучения NoPE-модели стала указывать на значимость токена независимо от будущего запроса.

Политика читает 11% каждой строки кэша, ранжирует токены по этому сигналу и оставляет наиболее значимые строки в активном слое внимания. Остальные строки не удаляются: они без изменений переходят в архив на GPU. Во время генерации компактный индекс проверяет архив и возвращает строки, способные конкурировать с активными токенами.

Метод не требует переобучения, квантования, изменения весов или вычислительных ядер. При 32-кратном сокращении активного слоя автор оценил уменьшение объёма чтения на пути KV примерно в четыре раза; фактическое ускорение готового вычислительного ядра в работе не измерялось.

Что это значит

VestigeKV предлагает снижать нагрузку длинного контекста не по уже наблюдавшемуся вниманию, а по сигналу внутри самой модели. Это подходит для долговечных кэшей, которые приходится сжимать до появления запросов к сохранённым данным. Однако стандартная конфигурация держит архив на GPU, поэтому сокращает прежде всего объём чтения при внимании, а не общий расход видеопамяти. Выгрузка архива в оперативную память предусмотрена как отдельный вариант.

Ограничения. Все основные замеры проведены на одной модели Kimi Linear 48B, на извлечении скрытого фрагмента и продолжении документов с контекстом до 65 тысяч токенов. Перенос на Kimi K3 автор называет возможным, но не проверял; стандартные наборы задач для длинного контекста также не использовались. Сравнение с H2O и SnapKV проведено в режиме, где будущий запрос отсутствует при сжатии, хотя эти методы рассчитаны на наблюдавшееся внимание, поэтому результаты не доказывают общего превосходства VestigeKV. Перенос на архитектуры с RoPE замеры автора не подтверждают.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу