Журнал · Rit.work

SGD-KV сжимает KV-кэш с учётом специализации голов внимания

Авторы SGD-KV предлагают сохранять больше контекста для голов внимания, отвечающих за обобщение, и сокращать память KV-кэша до 75%.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи USC, KAIST и Amazon AGI представили SGD-KV — способ сокращать память KV-кэша, в котором хранятся промежуточные ключи и значения механизма внимания. В препринте, не проходившем рецензирование, авторы измерили снижение расхода этой памяти до 75%. Работа важна разработчикам систем для анализа длинных документов и многоходовых диалогов, где размер KV-кэша ограничивает доступную длину контекста.

Что сделали

Вместо одинаковых правил для всех голов внимания — параллельных блоков, обрабатывающих разные связи между токенами, — SGD-KV оценивает их специализацию. Для этого авторы объединяют документы из наборов данных для суммаризации, а модель должна разделить полученный текст на смысловые фрагменты и подобрать ключевые слова для каждого из них.

Затем метод измеряет, насколько сильно каждая голова связывает сгенерированные ключевые слова с соответствующими участками исходного текста. Полученная оценка определяет долю кэша: головы, лучше агрегирующие информацию, сохраняют больше предыдущих токенов. Начало последовательности и недавние токены защищены от удаления, а оставшийся бюджет перераспределяется между головами; внутри выделенной доли записи выбираются по накопленному вниманию.

На MRCR с контекстом в миллион токенов SGD-KV при бюджете в четверть полного кэша превысил HeadKV на 5,26 пункта. Авторы также получили близкий к полному кэшу средний результат на ETHIC.

Что это значит

Работа предлагает разделить сжатие на два этапа: заранее определить функциональную роль голов, а при обработке запроса распределять память согласно этой оценке. Это отличается от подходов, которые учитывают главным образом недавность токена или накопленное внимание. Для внедрения потребуется построить оценки голов для выбранной модели и добавить управляемое распределение бюджета в механизм вывода.

Ограничения. Метод проверяли только на Qwen2.5-7B-Instruct-1M и Qwen3-32B, используя MRCR, ETHIC и BABILong; первый вариант Qwen авторы дополнительно дообучили из-за слабых результатов исходной контрольной точки на многоходовых диалогах. Работа не показывает задержку, пропускную способность и фактическое потребление памяти GPU в производственной системе. В сравнении также нет моделей других семейств, поэтому переносимость найденной специализации голов остаётся непроверенной.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу