Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Длинную цепочку рассуждений можно сжимать, не выбрасывая ранний план решения, к которому модель вернётся позже. В нерецензированном препринте Hanyang University и Sungkyunkwan University, где все числа получены самими авторами, BeaconKV обычно сохранял долю правильных ответов лучше, чем RPC и R-KV. Для систем с длинной генерацией это открывает путь к более крупным пакетам запросов на той же GPU без дообучения модели.
Почему последних запросов недостаточно
При генерации модель хранит для каждого прошлого токена кэш ключей и значений (KV-cache). Благодаря ему модель не пересчитывает весь предыдущий текст на каждом шаге, но размер кэша растёт вместе с цепочкой рассуждений и в итоге упирается в память GPU.
RPC, R-KV и другие методы освобождают память, оценивая, какие записи понадобятся позже. Обычно они смотрят на запросы внимания из последних шагов: если недавние токены почти не обращались к старому фрагменту, его можно удалить.
BeaconKV исходит из того, что в длинном рассуждении такой прогноз систематически ошибается. Большую часть времени модель действительно работает с ближайшим контекстом, но отдельные токены снова направляют внимание на условие задачи, ограничения или план, сформулированный намного раньше. Авторы называют их токенами возврата к рассуждению.
Такие возвраты возникают нерегулярно и распределены между слоями и головами внимания. Если очередная очистка кэша пришлась на локальный фрагмент вычислений, метод по последним запросам может удалить ранние записи, которые понадобятся через несколько шагов.
Анализ представлений запросов показал более полезную закономерность: запросы, возвращающие модель к далёкому контексту, образуют несколько групп по сходству. Два запроса могут находиться далеко друг от друга в тексте, но искать похожие ранние фрагменты и располагаться рядом в пространстве представлений.
Как маячковые запросы сохраняют дальний контекст
BeaconKV хранит не всю историю запросов, а компактный набор представителей этих групп — маячковые запросы. При очередной очистке метод оценивает записи кэша одновременно по недавним и маячковым запросам. Поэтому старый фрагмент остаётся в памяти, даже если текущий участок рассуждения временно на него не смотрит.
Маяки выбирает последовательный вариант алгоритма наиболее удалённых точек. Он берёт запросы, которые геометрически сильнее всего отличаются от уже сохранённых, и тем самым покрывает разные способы обращения к истории. Отбор продолжается по мере генерации, поэтому набор меняется вместе с рассуждением и не сводится к сохранению его начала.
В одном из сравнений лучший результат дала комбинация из 16 недавних и 16 отобранных запросов, а простое расширение окна последних токенов работало хуже. Значит, важен не объём недавней истории сам по себе, а разнообразие шаблонов, по которым модель позднее ищет старый контекст.
Метод не обучает отдельный модуль и не меняет архитектуру модели. Он работает внутри процедуры очистки кэша: рассчитывает оценки важности, оставляет записи с наибольшими оценками и повторяет эту операцию при следующем заполнении выделенного бюджета памяти.
Проверка охватила четыре открытые модели семейств DeepSeek-R1, Llama и Qwen, а также четыре набора задач по математике, программированию и естественным наукам: AIME24, MATH-500, LiveCodeBench и GPQA-Diamond. Системные замеры проводили отдельно на Qwen3-4B, поэтому результаты описывают прежде всего длинные рассуждения на этих моделях и задачах, а не любую генерацию текста.
Работа меняет план оптимизации, но не выбор модели
На генерации длиной 32 тысячи токенов пиковый расход памяти снизился с 77 до 13,3 ГБ. Пропускная способность выросла более чем в 4,3 раза, поскольку освободившаяся память позволила обрабатывать больше последовательностей параллельно.
По доле правильно решённых задач BeaconKV выигрывал у существующих способов сжатия вплоть до 31,7 процентного пункта при отдельных бюджетах кэша. При одинаковом лимите памяти системная скорость оставалась сопоставимой с RPC: преимущество возникало не из-за дополнительных вычислительных ресурсов, а из-за более удачного выбора сохраняемых записей.
Для команды, которая уже выбрала открытую рассуждающую модель, работа предлагает изменить порядок оптимизации. Прежде чем сокращать длину ответа, переходить на более крупную GPU или обучать собственный механизм очистки, можно проверить сжатие по маячковым запросам на реальных трассах продукта.
Практический критерий здесь — не только средняя точность. Следует отдельно измерить максимальный расход памяти, пропускную способность и качество при жёстком бюджете кэша: именно в таком режиме различия между способами очистки становятся заметными.
Для обычных коротких ответов основание менять инфраструктуру слабее: проблема появляется, когда модель генерирует длинный промежуточный ход решения и периодически возвращается к ранним ограничениям. BeaconKV не меняет способности самой модели и не сокращает число токенов; он позволяет дешевле обслуживать уже выбранный режим рассуждения.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



