Журнал · Rit.work

Модель сама выбирает, какую часть KV-кэша читать

Declarative Attention позволяет LLM переключаться между полным контекстом, выбранным фрагментом и собственным ответом, сокращая чтение KV-кэша ценой небольшой потери точности.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из KAIST AI и Google DeepMind предложили Declarative Attention — протокол, в котором модель сама указывает нужную ей область контекста; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, на Gemma-4-31B метод сократил суммарное число токенов, прочитанных механизмом внимания при генерации, на 52%. Результат важен командам, которые обслуживают LLM с длинным контекстом и упираются в пропускную способность памяти GPU.

Что сделали

При обычной генерации глобальные слои внимания на каждом шаге читают из KV-кэша ключи и значения для всего предыдущего контекста. Даже если ответ зависит от одного абзаца большого документа, модель сначала просматривает весь кэш, чтобы вычислить веса внимания. Чем длиннее контекст, тем больше данных приходится передавать из памяти GPU для каждого нового токена.

Declarative Attention, или DA, переносит выбор области внимания в текстовую цепочку рассуждений модели. Контекст заранее делят на адресуемые фрагменты примерно по 2048 токенов. Модель переключается между тремя режимами:

  • <global> — виден весь контекст; режим нужен для поиска подходящего фрагмента.
  • <focus> — виден только названный моделью фрагмент или несколько фрагментов.
  • <local> — исходный контекст скрыт, а модель работает с вопросом и уже сформированной частью ответа.

Исполнительная среда разбирает эти объявления как вызовы инструментов и меняет маску внимания во время генерации. Сам KV-кэш не удаляется и не сжимается: механизм пропускает блоки, которые модель не запросила на текущем шаге.

Авторы встроили конечный автомат DA в vLLM. Он переписывает таблицу доступных блоков KV-кэша, не меняя ядра FlashAttention и планировщик запросов. Метод применяется только к глобальным слоям внимания: локальные окна и рекуррентные механизмы с фиксированной стоимостью остаются без изменений.

Что показали

Авторы проверили DA без дополнительного обучения на готовых моделях и наборе из 15 задач с длинным контекстом. Основное сравнение проводилось на Gemma-4-31B и Qwen-3.6-27B против обычной генерации с полным вниманием.

На Qwen-3.6-27B суммарное число токенов, прочитанных вниманием, уменьшилось на 31,1%. Экономия на Gemma из лида сопровождалась снижением точности на 1,27 процентного пункта, а на Qwen разница составила 2,75 процентного пункта. Авторы также измерили модели меньшего размера и утверждают, что разрыв в точности сокращался с ростом модели.

Сравнение с вариантом, который генерировал те же служебные теги, но не применял динамическую маску, показало источник экономии. Дополнительная цепочка рассуждений сама по себе увеличивает число шагов генерации; выигрыш появляется именно тогда, когда исполнительная среда перестаёт читать невыбранные блоки KV-кэша.

Работа измеряет прежде всего объём внимания, а не фактическую задержку ответа. Изменение времени декодирования авторы рассчитывают с помощью аппаратной модели, учитывающей вычислительную производительность и пропускную способность памяти. Это прогноз для оптимизированного обслуживания с большой пакетной обработкой, а не результат производственного испытания.

Ограничения

DA проверяли на шести моделях двух семейств и на задачах из RULER, LongBench, LooGLE и ZeroSCROLLS. Основные результаты относятся только к двум старшим моделям, а контексты в экспериментах имели порядок сотен тысяч токенов. Работа не показывает, как метод ведёт себя на других архитектурах, в диалоговых продуктах с постоянно меняющейся историей или при коротком контексте.

Авторы не приводят измеренной сквозной задержки и стоимости обслуживания на работающем кластере. Поэтому уменьшение чтения KV-кэша нельзя напрямую считать таким же уменьшением времени ответа или счёта за GPU: результат зависит от размера пакета, длины контекста, доли глобальных слоёв и накладных расходов на дополнительные токены рассуждения.

Сравнение с другими способами разреженного внимания остаётся неполным. Авторы обсуждают методы с отдельным оценщиком релевантности, но основная экспериментальная линия сопоставляет DA с обычным вниманием и собственной абляцией без маски. Кроме того, неудачный выбор фрагмента скрывает нужные данные от модели, поэтому потеря точности зависит не только от качества ответа, но и от способности модели соблюдать протокол и правильно адресовать сегменты.

Что это значит

Работа не даёт основания менять выбранную модель или архитектуру продукта. Она предлагает дополнительный режим исполнения для систем, где длинный контекст уже стал измеримой причиной высокой стоимости декодирования. Для такой команды DA можно рассматривать как прототип оптимизации рядом с разреженным вниманием, поиском по документам и сокращением истории.

Внедрение потребует контролировать формат контекста, делить его на устойчивые сегменты и поддерживать собственную интеграцию с исполнительной средой. Одного изменения системной инструкции недостаточно: без динамической маски служебные рассуждения только добавят токены к ответу.

Практический следующий шаг — воспроизвести метод на реальных трассах запросов и измерить точность, задержку, пропускную способность и стоимость GPU одновременно. Если продукт работает с короткими запросами или использует закрытый API без управления маской KV-кэша, работа планов не меняет. Если команда обслуживает открытые модели самостоятельно и регулярно обрабатывает документы на сотни тысяч токенов, DA добавляет проверяемую гипотезу оптимизации, но пока не готовое основание для производственного перехода.

Источники

Иллюстрация: рисунок из статьи «Language Models Can Control Their Own Attention», Namgyu Ho, Huzama Ahmad, Woosung Koh и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу