Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи USC, KAIST и Amazon AGI представили SGD-KV — способ сокращать память KV-кэша, в котором хранятся промежуточные ключи и значения механизма внимания. В препринте, не проходившем рецензирование, авторы измерили снижение расхода этой памяти до 75%. Работа важна разработчикам систем для анализа длинных документов и многоходовых диалогов, где размер KV-кэша ограничивает доступную длину контекста.
Что сделали
Вместо одинаковых правил для всех голов внимания — параллельных блоков, обрабатывающих разные связи между токенами, — SGD-KV оценивает их специализацию. Для этого авторы объединяют документы из наборов данных для суммаризации, а модель должна разделить полученный текст на смысловые фрагменты и подобрать ключевые слова для каждого из них.
Затем метод измеряет, насколько сильно каждая голова связывает сгенерированные ключевые слова с соответствующими участками исходного текста. Полученная оценка определяет долю кэша: головы, лучше агрегирующие информацию, сохраняют больше предыдущих токенов. Начало последовательности и недавние токены защищены от удаления, а оставшийся бюджет перераспределяется между головами; внутри выделенной доли записи выбираются по накопленному вниманию.
На MRCR с контекстом в миллион токенов SGD-KV при бюджете в четверть полного кэша превысил HeadKV на 5,26 пункта. Авторы также получили близкий к полному кэшу средний результат на ETHIC.
Что это значит
Работа предлагает разделить сжатие на два этапа: заранее определить функциональную роль голов, а при обработке запроса распределять память согласно этой оценке. Это отличается от подходов, которые учитывают главным образом недавность токена или накопленное внимание. Для внедрения потребуется построить оценки голов для выбранной модели и добавить управляемое распределение бюджета в механизм вывода.
Ограничения. Метод проверяли только на Qwen2.5-7B-Instruct-1M и Qwen3-32B, используя MRCR, ETHIC и BABILong; первый вариант Qwen авторы дополнительно дообучили из-за слабых результатов исходной контрольной точки на многоходовых диалогах. Работа не показывает задержку, пропускную способность и фактическое потребление памяти GPU в производственной системе. В сравнении также нет моделей других семейств, поэтому переносимость найденной специализации голов остаётся непроверенной.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



