Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Исследователи Shenzhen Institutes of Advanced Technology, Pengcheng Laboratory и партнёрских организаций представили GrowPage для управления KV-кэшем при обслуживании рассуждающих LLM; работа опубликована как препринт, не проходивший рецензирования. В одном из замеров авторы получили почти в 1,9 раза более высокую пропускную способность при точности pass@1 85,1% — доле задач, решённых с первого ответа. Разработка важна для команд, которым нужно размещать больше длинных запросов в ограниченной памяти GPU.
Что сделали
KV-кэш хранит промежуточные ключи и значения механизма внимания, чтобы модель не пересчитывала весь контекст при генерации очередного токена. Обычное сжатие задаёт запросу фиксированный объём кэша заранее: маленький лимит может удалить важную историю, большой — оставить часть памяти неиспользованной.
GrowPage рассматривает ёмкость кэша как изменяемый ресурс. Система поддерживает краткосрочное и долгосрочное представления запросов к механизму внимания и по расхождению между ними оценивает, расширяется ли набор нужной истории. Когда выделенная память заканчивается, GrowPage либо уплотняет сохранённые состояния в прежнем объёме, либо запрашивает ещё одну физическую страницу.
Механизм встроен в PagedAttention и сохраняет непрерывное пакетирование и кэширование общих префиксов. По замерам авторов, направление изменения спроса было определено верно в 80,3% случаев, а дополнительные операции занимали менее 0,32% времени декодирования.
Что это значит
Для инфраструктуры LLM это способ отказаться от единого компромисса между экономией памяти и качеством ответа. Запросы с концентрированным вниманием остаются в прежнем лимите, а запросы, которым требуется больше истории, получают дополнительную страницу. Если свободной страницы нет, система возвращается к сжатию и передаёт дальнейшее управление общему планировщику.
Ограничения. Авторы проверяли подход на двух моделях размера 8B и пяти наборах задач по математике и генерации кода. Работа не показывает, сохранится ли результат на моделях других размеров, диалоговых нагрузках и производственных трассах с иным распределением длины запросов. Проведённое сравнение охватывает методы с фиксированным бюджетом KV-кэша, но не даёт сопоставления с другими реализациями динамического изменения ёмкости в независимых серверных системах.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



