Журнал · Rit.work

GrowPage наращивает KV-кэш LLM по ходу генерации

GrowPage заменяет фиксированный лимит KV-кэша постраничным расширением, чтобы повысить пропускную способность сервера без заметной потери качества рассуждений.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи Shenzhen Institutes of Advanced Technology, Pengcheng Laboratory и партнёрских организаций представили GrowPage для управления KV-кэшем при обслуживании рассуждающих LLM; работа опубликована как препринт, не проходивший рецензирования. В одном из замеров авторы получили почти в 1,9 раза более высокую пропускную способность при точности pass@1 85,1% — доле задач, решённых с первого ответа. Разработка важна для команд, которым нужно размещать больше длинных запросов в ограниченной памяти GPU.

Что сделали

KV-кэш хранит промежуточные ключи и значения механизма внимания, чтобы модель не пересчитывала весь контекст при генерации очередного токена. Обычное сжатие задаёт запросу фиксированный объём кэша заранее: маленький лимит может удалить важную историю, большой — оставить часть памяти неиспользованной.

GrowPage рассматривает ёмкость кэша как изменяемый ресурс. Система поддерживает краткосрочное и долгосрочное представления запросов к механизму внимания и по расхождению между ними оценивает, расширяется ли набор нужной истории. Когда выделенная память заканчивается, GrowPage либо уплотняет сохранённые состояния в прежнем объёме, либо запрашивает ещё одну физическую страницу.

Механизм встроен в PagedAttention и сохраняет непрерывное пакетирование и кэширование общих префиксов. По замерам авторов, направление изменения спроса было определено верно в 80,3% случаев, а дополнительные операции занимали менее 0,32% времени декодирования.

Что это значит

Для инфраструктуры LLM это способ отказаться от единого компромисса между экономией памяти и качеством ответа. Запросы с концентрированным вниманием остаются в прежнем лимите, а запросы, которым требуется больше истории, получают дополнительную страницу. Если свободной страницы нет, система возвращается к сжатию и передаёт дальнейшее управление общему планировщику.

Ограничения. Авторы проверяли подход на двух моделях размера 8B и пяти наборах задач по математике и генерации кода. Работа не показывает, сохранится ли результат на моделях других размеров, диалоговых нагрузках и производственных трассах с иным распределением длины запросов. Проведённое сравнение охватывает методы с фиксированным бюджетом KV-кэша, но не даёт сопоставления с другими реализациями динамического изменения ёмкости в независимых серверных системах.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу