Журнал · Rit.work

KV-кэша недостаточно: Qwen передала память от младшей модели старшей

LatentPort переносит KV-кэш и рекуррентную память между Qwen3.5 разного размера, чтобы старшая модель продолжила текст без повторного чтения контекста.

Rit.work
Студия разработки
23 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Живую память одной языковой модели удалось передать другой так, чтобы принимающая модель не перечитывала исходный контекст. Хотя препринт не прошёл рецензирование и числа получил сам автор, Simon P. Villani показал, что Qwen3.5-9B после передачи предсказывает продолжение лучше, чем Qwen3.5-4B, которая читала исходный текст. Для систем с переключением моделей это расширяет предмет переноса: одного KV-кэша гибридной LLM недостаточно.

Кроме KV-кэша пришлось переносить рекуррентную память

В обычном слое внимания KV-кэш хранит ключи и значения для предыдущих токенов. Принимающая модель использует их, чтобы не вычислять представление всего контекста заново. Ранее межмодельный перенос состояния в основном работал с этой частью.

Qwen3.5 сочетает слои внимания со слоями Gated DeltaNet. Последние поддерживают рекуррентные матрицы и историю свёртки: это постоянное состояние, которое обновляется по мере чтения текста и влияет на следующие токены. Если перенести только KV-кэш, эта часть памяти останется пустой.

LatentPort передаёт состояние от Qwen3.5-4B к Qwen3.5-9B. У моделей различаются веса и ширина скрытого слоя, но совпадают число и устройство слоёв, размеры рекуррентных матриц, структура истории свёртки и геометрия KV-кэша. Поэтому состояние можно установить в старшую модель без обрезки или дополнения тензоров.

Совпадение форм решает только техническую задачу копирования. Оно не гарантирует, что старшая модель одинаково прочитает память, которую сформировали другие проекции и механизмы обновления. Поэтому совместимость проверяли по поведению модели после передачи, а не только по близости тензоров.

KV-кэш переводили обученными линейными преобразованиями. Рекуррентные матрицы и историю свёртки оказалось выгоднее копировать напрямую: обученные преобразования точнее восстанавливали внутренние тензоры старшей модели, но давали худшее продолжение. Затем поверх состояния добавили небольшую корректирующую модель на 434 176 параметров.

Исходная модель читала префикс длиной 4K токенов. Принимающая получала готовое состояние, один настоящий следующий токен и затем продолжение; исторические токены через неё не пропускали. В пакет также входили служебные признаки инициализации, поэтому результат нельзя приписать только рекуррентным матрицам.

Полное состояние сохранило большую часть пользы контекста

Добавление рекуррентного состояния и истории свёртки к уже переведённому KV-кэшу снизило среднюю логарифмическую ошибку на 0,747 ната на токен. Улучшение появилось во всех 64 документах PG19, а не только в нескольких удачных примерах. Нат на токен здесь показывает, насколько низкую вероятность модель назначает правильному следующему токену: меньше — лучше.

После выбора компонентов и коррекции ошибка принимающей модели оставалась на 0,076 ната на токен выше результата той же модели, которая сама прочитала контекст. Перенос восстановил 91,8% пользы, которую контекст давал старшей модели по сравнению с её пустым состоянием. Это доля восстановленного эффекта контекста, а не точность ответов.

Принимающая модель также обошла продолжавшую работу исходную модель на 0,052 ната на токен. Если вместо правильного состояния ей передавали память от другого документа, преимущество исчезало. Значит, она использовала сведения именно из нужного контекста, а не просто получала удачную начальную настройку.

Результаты получены при проверке с известным продолжением: на каждом шаге модели подавали правильный предыдущий токен. Такой режим измеряет качество распределения вероятностей, но не показывает, будут ли ошибки накапливаться при свободной генерации.

Менять архитектуру сервинга рано, но интерфейс состояния уже стоит учитывать

Работа подтверждает узкий, но полезный сценарий: модель меньшего размера читает длинный контекст, после чего более крупная модель продолжает обработку без повторного чтения. Это может пригодиться маршрутизаторам моделей и многоступенчатым системам, где запрос повышают до более дорогой модели после накопления истории.

Перенос проверили только в одном направлении между родственными Base-моделями с полностью совпадающей геометрией состояния. Использовались два корпуса, короткие продолжения и префиксы одной длины; ветку с 16K не запускали. Свободную генерацию, прикладные задачи, Instruct-модели, другие семейства и несовпадающие формы состояния работа не покрывает.

Замеры также не доказывают ускорение готового сервиса. Время перевода состояния, его передачу между процессами и другие расходы не свели в сквозной производственный тест. Поэтому заменять повторное чтение контекста новым механизмом в плане разработки пока рано.

Для исследовательского прототипа вывод конкретнее. Интерфейс гибридной модели должен описывать не только KV-кэш, но и рекуррентные матрицы, историю свёртки, признаки инициализации и правила нумерации слоёв. Совместимость следует проверять по качеству продолжения: близость внутренних тензоров в этой работе предсказывала результат хуже, чем непосредственный поведенческий тест.

Если эффект повторится на других парах, семейства моделей можно будет обучать с общим договором о формате состояния. Тогда переключение размера станет штатной операцией, а не отдельным переводчиком для каждой пары. Пока LatentPort показывает лишь то, что такой договор возможен при особенно благоприятном совпадении архитектур.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу