Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Renjie Xie и соавторы разработали HeadWiseKV — способ заранее распределить память KV-кеша между головами внимания в гибридных языковых моделях; результаты опубликованы в препринте, который не проходил рецензирования. В испытании Qwen3.6-27B на фиксированной конфигурации наибольший успешно обработанный контекст вырос со 114K до 161K токенов. Работа важна командам, которые запускают длинноконтекстные модели на собственных GPU и упираются в память при обработке запросов.
Что сделали
KV-кеш хранит ключи и значения внимания для уже обработанных токенов, чтобы модель не вычисляла их заново при генерации. В слоях глобального внимания его размер растёт вместе с контекстом и числом параллельных запросов. Гибридные модели частично заменяют глобальное внимание локальными или рекуррентными блоками, но оставшиеся глобальные слои всё равно могут определять, поместится ли запрос в память.
HeadWiseKV назначает каждой физической KV-голове собственную длину сохраняемой истории. Одни головы могут видеть весь предыдущий контекст, другие — только непрерывный фрагмент последних токенов. Политика статична: её рассчитывают до обслуживания запросов, поэтому среде выполнения заранее известно, сколько памяти выделить каждой голове.
Это отличает метод от подходов, которые сначала строят полный кеш, а затем выбирают или удаляют токены на основании текущего запроса. Такая фильтрация способна сократить работу внимания, но не обязательно уменьшает пик памяти на этапе первичной обработки запроса. В HeadWiseKV среда выполнения физически создаёт кеши выбранной длины, а не накладывает разреженную маску на уже выделенный полный кеш.
Политику формирует алгоритм SeqCalib. Он проходит слои в порядке выполнения и для каждой головы ищет самое короткое допустимое окно, при котором выход внимания остаётся достаточно похожим на результат с полной историей. При обработке верхнего слоя алгоритм сохраняет ограничения, уже выбранные для нижних слоёв. Это нужно потому, что сокращение раннего кеша меняет представления, поступающие дальше по модели.
Получается набор политик с разным расходом памяти. Из него выбирается вариант, укладывающийся в заданный бюджет. Переобучение модели и изменение её архитектуры не требуются; локальные, линейные и рекуррентные пути остаются без изменений.
Что показали
Качество авторы проверяли относительно Full-KV — режима, в котором глобальные головы сохраняют полную историю. При сохранении 68,95% исходного объёма на Qwen3.6-27B результат RULER снизился на 0,35 балла, а оценка LoCoMo не изменилась. RULER проверяет поиск и использование информации в длинном контексте, LoCoMo — память о продолжительных диалогах.
Сокращение номинального кеша перешло в экономию памяти среды выполнения: по замерам авторов, пиковое потребление памяти устройства уменьшилось на 8,59%. Скорость первичной обработки контекста составила 1,092 от Full-KV, а скорость последующей генерации — 1,017. Иными словами, в этой конфигурации выигрыш по вместимости не сопровождался измеренным замедлением относительно полного кеша.
На других исследованных гибридных моделях результат зависел от семейства и задачи. По утверждению авторов, поиск информации в длинном контексте переносился устойчивее, чем ответы по истории диалога. Поэтому одинаковый порог сходства не превращается в универсальный процент экономии памяти: политику нужно рассчитывать отдельно для каждой модели.
Ограничения
Проверка качества охватывает четыре гибридные модели и наборы RULER, LoCoMo и домены агентных задач τ2-Bench. Системные измерения памяти, пропускной способности и предельного контекста проведены как фиксированное исследование Qwen3.6-27B с конкретными форматами весов и KV-кеша. Контексты длиннее 128K использовались как проверка вместимости, а не как оценка качества ответов.
Прямые отношения памяти и скорости авторы вычисляли только между HeadWiseKV и Full-KV из одной согласованной серии запусков. Остальные методы запускались в отдельных сериях или с адаптированными реализациями, поэтому работа не даёт сопоставимого общего рейтинга качества, памяти и задержки для всех альтернатив. Более того, показатели качества и системные показатели для основного режима записаны отдельно и не образуют единого замера.
Статическая политика не учитывает содержание конкретного запроса и сохраняет непрерывный хвост истории. Работа поэтому не показывает, насколько метод подходит нагрузкам, где ответ зависит от редких токенов далеко в прошлом. SeqCalib также выбирает лучшее окно последовательно для каждого уже сформированного префикса слоёв, но не гарантирует глобально оптимального распределения памяти по всей модели.
Что это значит
Для команд, которые уже выбрали гибридную длинноконтекстную модель и ограничены памятью GPU, работа меняет план оптимизации: перед уменьшением точности кеша, заменой модели или добавлением оборудования имеет смысл проверить неравномерное распределение истории между KV-головами. Главное инженерное преимущество здесь — предсказуемый объём памяти до начала обработки запроса. Это упрощает расчёт допустимой длины контекста и числа параллельных запросов.
Результат пока не обосновывает замену существующей среды обслуживания только ради HeadWiseKV. Для внедрения потребуется поддержка физических кешей разной длины, отдельная калибровка каждой версии модели и проверка на целевых запросах. Если продукт зависит от точного извлечения единичных фактов из начала истории, статические окна следует сравнить с методами, выбирающими токены по содержанию запроса.
Практический вывод уже применим к архитектурному планированию: остаточные слои глобального внимания в гибридной модели нельзя считать несущественными для памяти. Авторы показали, что их кеш можно бюджетировать на уровне отдельных голов и превратить расчётную экономию в физически меньшую резидентность. Однако ожидаемую вместимость и качество следует подтверждать на выбранной модели, среде выполнения и рабочем распределении запросов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



