Журнал · Rit.work

Где хранить знания LLM: в контексте, KV-кэше или весах

Сравнение контекста, KV-кэшей и донастройки показывает, какой способ лучше отвечает по документам, экономит вычисления и сохраняет общие навыки модели.

Rit.work
Студия разработки
16 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

У способа передать LLM новые документы нет единственного победителя: контекст не требует обучения, сжатые представления экономят повторную обработку, а запись в параметры дешевле при каждом запросе. В препринте Amazon, который не прошёл рецензирование и содержит числа самих авторов, Cartridges единственными сравнялись с обычным контекстом при поиске по нескольким документам. Выбор способа хранения теперь зависит не только от точности, но и от частоты запросов, состава базы и допустимого ущерба общим навыкам модели.

Как документ превращали в контекст, KV-кэш или параметры

Самый прямой вариант — добавить найденный документ в контекст модели. Так работает обычная генерация с поиском по базе: система выбирает подходящие фрагменты, а модель заново обрабатывает их для каждого запроса. Это сохраняет исходный текст, но расход растёт вместе с длиной документов.

Cartridges и Compaction вместо текста сохраняют KV-кэш — набор внутренних представлений, к которым модель обращается во время ответа. Cartridges обучает для каждого документа небольшой префикс. Compaction сжимает уже рассчитанный кэш так, чтобы воспроизвести внимание модели к полному документу.

Параметрические способы записывают знания в веса. Работа сравнивает LoRA, дополнительные MLP-модули и полную донастройку. LoRA меняет веса только в ограниченном низкоранговом подпространстве, MLP-модули добавляют обучаемые блоки между слоями, а полная донастройка обновляет всю модель.

Для каждого документа создавали отдельный адаптер на синтетических вопросах и ответах. Учителем служила та же модель с полным документом в контексте: адаптер учили повторять распределение её ответов, а не просто предсказывать следующий токен исходного текста.

Методы проверяли на пяти наборах задач: медицинских записях, научных статьях, длинных рассказах, финансовых отчётах и документации IBM. Основной моделью была Qwen3-8B, результаты дополнительно проверили на Gemma-3-12B. Отдельные тесты измеряли, сохраняет ли модель умение решать задачи по математике, писать код, выполнять инструкции и отвечать на общие вопросы.

Сжатие выдерживает один документ, но ломается при объединении

Когда системе заранее давали правильный документ, методы на KV-кэше опережали запись знаний в параметры. Cartridges сохраняли преимущество почти при любом размере хранилища и превосходили параметрические методы примерно на 10 пунктов. Compaction хорошо работал при слабом сжатии, но после 50× уступал параметрическим адаптерам примерно те же 10 пунктов.

Более практичный эксперимент начинался с поиска: система извлекала несколько документов, после чего объединяла соответствующие адаптеры. KV-кэши соединяли последовательно, а параметрические обновления усредняли. Здесь различия между методами стали заметнее.

Cartridges сравнялись с передачей исходного текста в контексте и опередили параметрические способы на 29 пунктов, а Compaction — на 15. Усреднение независимо обученных LoRA и других весов плохо переносило посторонние документы. Независимо сжатые кэши Compaction также мешали друг другу, тогда как Cartridges заранее обучали работать в составе нескольких префиксов.

Сравнение охватывает две модели среднего размера и задачи на извлечение знаний, но не обучение новым навыкам. Для нескольких документов использовали один конвейер поиска и стандартные способы объединения: последовательное соединение кэшей и усреднение весов. Более сложная маршрутизация или слияние адаптеров может дать другой результат.

Планы стоит менять только для стабильных и часто используемых баз

Работа не даёт причины заменять текстовый поиск по документам во всех продуктах. Контекст остаётся подходящей отправной точкой, если документы часто меняются, ответы нужно связывать с исходными фрагментами, а дополнительное обучение и хранение адаптеров не окупаются. Его слабое место — модель снова обрабатывает найденный текст при каждом запросе.

Cartridges становятся практичнее, когда один и тот же массив документов обслуживает много запросов. Документ можно обработать заранее, хранить сжатый KV-кэш и загружать только представления найденных частей. При этом размер кэша всё ещё зависит от длины документа, а модель продолжает учитывать его во время генерации.

За экономию приходится следить отдельными тестами. Cartridges снизили средний результат на контрольных задачах на 6%, а в генерации кода — на 13%. Compaction такого забывания не показал, но хуже объединял несколько документов. LoRA лучше сохраняла общие способности, однако уступала по ответам из базы и не выдерживала простого слияния адаптеров.

Параметрические методы подходят, когда важнее минимальная стоимость каждого ответа и фиксированный размер артефакта, не зависящий от длины документа. Но архитектуру не стоит строить на предположении, что отдельный LoRA для каждого файла можно просто объединить после поиска. В проверенном конвейере совместное обучение на всей базе работало надёжнее такого слияния.

Практический выбор сводится к профилю нагрузки. Для изменяемой базы и прозрачных ответов остаётся текстовый поиск; для стабильного корпуса с повторными запросами можно испытывать Cartridges; для самого дешёвого выполнения — параметрическую адаптацию, если знания допустимо обучать совместно. В двух последних случаях контрольные тесты должны входить в выпуск адаптера наравне с проверкой ответов по документам.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу