Журнал · Rit.work

Скоринг KV-кэша оказался необязательным для длинных рассуждений

Random Attention сохраняет входной запрос, случайно очищает остальной KV-кэш и по замерам авторов ускоряет генерацию без заметной потери точности.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Команда Salesforce AI Research и University of Illinois Urbana-Champaign представила Random Attention для ограничения памяти при длинных рассуждениях; работа опубликована как препринт, который не проходил рецензирование. По замерам авторов, метод обеспечил на 32–43% больше генерируемых токенов в секунду, чем лучший сопоставленный алгоритм вытеснения. Результат важен командам, которые обслуживают рассуждающие модели с длинной генерацией и упираются в объём GPU-памяти.

Что сделали

Во время генерации LLM сохраняет для каждого предыдущего токена ключи и значения механизма внимания — KV-кэш. Его размер растёт вместе с ответом, поэтому длинная цепочка рассуждений постепенно занимает всё больше памяти. Вытеснение ограничивает кэш фиксированным бюджетом: часть записей удаляется без возможности восстановить их на следующих шагах.

Обычные методы перед удалением оценивают полезность каждой записи. Например, они учитывают накопленное внимание к позиции, внимание от недавних токенов, величину значений или статистику положения ключа. После этого в кэше остаются записи с наибольшей оценкой. Такой подход требует отдельного прохода по данным и предполагает, что оценка позволяет предсказать будущую полезность токена.

Random Attention разделяет вход и сгенерированную моделью часть. Системные инструкции, шаблон диалога и пользовательский запрос сохраняются полностью. Остальные позиции получают случайные оценки и независимо отбираются в каждой голове внимания. Настройки или предварительная калибровка для такого отбора не нужны.

Авторы проверили подход на моделях Qwen3 разных размеров и Phi-4-reasoning. Набор задач включал MATH500, GPQA-Diamond, AIME, HMMT и LiveCodeBench, то есть математику, естественные науки и программирование. Основные замеры проводились примерно при четырёхкратном сжатии типичной цепочки рассуждений. Для системного эксперимента метод встроили в vLLM и измерили обслуживание генераций длиной до 32 тыс. токенов на одном GPU H200.

Что показали

По средней точности Random Attention соответствовал лучшему из сравниваемых методов вытеснения на всех проверенных моделях. В основной таблице он оказался статистически значимо лучше альтернатив в 31 из 60 сравнений. Единственное статистически значимое преимущество другого метода авторы получили на задаче программирования с крупной версией Qwen3.

Контрольные эксперименты указывают, что основная разница между алгоритмами связана не с качеством ранжирования, а с сохранностью входного запроса. Когда авторы заставили сравниваемые методы полностью удерживать запрос, большая часть расхождений исчезла. Особенно это влияло на программирование: условия там длиннее и могут занять заметную часть доступного бюджета кэша.

Оставшаяся цепочка рассуждений, по интерпретации авторов, переносит случайное удаление благодаря двум видам избыточности. Модель повторяет промежуточные результаты в тексте, а разные головы внимания хранят собственные копии соответствующих ключей и значений. Независимое удаление по головам повышает вероятность, что нужная информация сохранится хотя бы в части из них.

Выигрыш в пропускной способности авторы связывают с отсутствием прохода для вычисления оценок. В пакетном обслуживании такое вычисление становится точкой синхронизации: запросы ждут, пока система просмотрит кэш и выберет записи. Random Attention выполняет только случайный отбор и общую для всех методов операцию уплотнения кэша.

Ограничения

Работа проверяет конкретный сценарий: сравнительно короткий запрос, длинная генерация рассуждений и необратимое вытеснение записей KV-кэша. Она не показывает, что случайный отбор будет столь же устойчив при длинных документах на входе, коротких ответах или задачах, где важная деталь встречается один раз и больше не повторяется.

Эксперименты охватывают два семейства моделей и шесть наборов задач. Системные замеры выполнены на одном типе GPU и для синтетически длинных генераций, а не для производственного потока с разными длинами запросов, требованиями к задержке и меняющейся пакетной нагрузкой. Поэтому измеренное преимущество нельзя напрямую переносить на другую инфраструктуру.

Сравнение также не отвечает на вопрос, можно ли лучше распределять память между входом и рассуждением. Random Attention всегда сохраняет запрос целиком. Для задач программирования это расходует значительную долю кэша, тогда как отдельный алгоритм мог бы удалять служебные или повторяющиеся части входа. Такой вариант авторы не реализовали.

Что это значит

Работа не требует менять выбранную LLM или архитектуру продукта. Она меняет порядок инженерных экспериментов вокруг обслуживания длинных рассуждений. До внедрения вычислительно сложного оценщика имеет смысл проверить более простой базовый вариант: полностью закрепить входной запрос, а оставшийся бюджет распределять случайно и независимо между головами внимания.

Для команд, ограниченных памятью GPU, это может сократить объём реализации и убрать дополнительный проход по KV-кэшу. Проверять нужно не только точность ответов, но и пропускную способность, задержку отдельного запроса, максимальный размер пакета и поведение на собственных распределениях длины. Главный практический риск — запросы, которые сами занимают большую часть бюджета.

Random Attention пока разумнее рассматривать как сильную исходную точку, а не универсальную замену ранжированию. Содержательный отбор остаётся потенциально полезным там, где модель должна сохранить редкий факт, не повторяемый в дальнейшем рассуждении, или где закрепление всего входа обходится слишком дорого. Новому алгоритму вытеснения теперь недостаточно превосходить прежние оценщики: ему нужно показывать преимущество над случайным отбором при одинаковой защите запроса и одинаковом бюджете памяти.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу