Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
vLLM планирует добавить Hybrid HiSparse в версию v0.30. Механизм, который Red Hat AI и Prime Intellect разработали вместе с сообществом vLLM, позволил держать запущенными 19–25 запросов к GLM 5.3 с контекстом в миллион токенов вместо 5–6.
При разреженном MLA модель обращается только к наиболее значимым токенам. Поэтому весь кеш ключей и значений (KV-кеш) не обязан постоянно находиться в HBM — быстрой памяти GPU.
Hybrid HiSparse оставляет KV-кеш на GPU, пока хватает места. Под нагрузкой запрос переносит реже используемые блоки в оперативную память, а на GPU сохраняет небольшой набор востребованных блоков. Один объединённый вычислительный модуль обрабатывает доступные, временно загруженные и отсутствующие строки, поэтому запрос продолжает генерацию, а не снимается с выполнения.
Разница примерно четырёхкратная, но пока относится к одной конфигурации: GLM 5.3 на сервере с восемью H200 и одинаковым объёмом оперативной памяти в обоих режимах. Для других моделей, ускорителей и распределённых серверов этот коэффициент переносить нельзя; практический вывод пока уже: длинный контекст можно обслуживать не только полным размещением KV-кеша в памяти GPU.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



