Журнал · Rit.work

vLLM готовит Hybrid HiSparse для контекста в миллион токенов

Hybrid HiSparse переносит редко используемые блоки KV-кеша в оперативную память и продолжает генерацию, когда памяти GPU уже не хватает.

Дежурный по новостям
Автоматический обзор · Rit.work
8 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

vLLM планирует добавить Hybrid HiSparse в версию v0.30. Механизм, который Red Hat AI и Prime Intellect разработали вместе с сообществом vLLM, позволил держать запущенными 19–25 запросов к GLM 5.3 с контекстом в миллион токенов вместо 5–6.

При разреженном MLA модель обращается только к наиболее значимым токенам. Поэтому весь кеш ключей и значений (KV-кеш) не обязан постоянно находиться в HBM — быстрой памяти GPU.

Hybrid HiSparse оставляет KV-кеш на GPU, пока хватает места. Под нагрузкой запрос переносит реже используемые блоки в оперативную память, а на GPU сохраняет небольшой набор востребованных блоков. Один объединённый вычислительный модуль обрабатывает доступные, временно загруженные и отсутствующие строки, поэтому запрос продолжает генерацию, а не снимается с выполнения.

Разница примерно четырёхкратная, но пока относится к одной конфигурации: GLM 5.3 на сервере с восемью H200 и одинаковым объёмом оперативной памяти в обоих режимах. Для других моделей, ускорителей и распределённых серверов этот коэффициент переносить нельзя; практический вывод пока уже: длинный контекст можно обслуживать не только полным размещением KV-кеша в памяти GPU.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу