Журнал · Rit.work

DeepSeek-V4.1-Flash сократила KV-кэш длинного контекста

DeepSeek уменьшила расход GPU-памяти в четыре раза, а хранилища — в восемь раз по сравнению с DeepSeek-V4-Flash, сохранив контекст до миллиона токенов.

Rit.work
Студия разработки
18 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Длинный контекст удалось обслуживать с меньшим расходом памяти. DeepSeek представила DeepSeek-V4.1-Flash: кэш ключей и значений (KV-кэш), который хранит промежуточное состояние внимания, занимает в GPU-памяти в четыре раза меньше, а на SSD или в памяти сервера — в восемь раз меньше, чем у DeepSeek-V4-Flash; препринт не рецензирован, и все числа в нём получила сама команда. Для систем с частыми вызовами инструментов это снижает требования не только к памяти, но и к переносу сохранённого контекста.

Архитектура CED делит модель на причинный энкодер и декодер. При первичной обработке запроса основную работу выполняет нижняя половина сети, а верхняя получает глобальный кэш из результатов энкодера. Поэтому на входных токенах модель активирует вдвое меньше параметров, чем при генерации ответа, — полезный режим для агентов, которые постоянно дописывают историю и повторно обрабатывают длинные запросы.

CSA2 позволяет слоям повторно использовать глобальные ключи, значения и выбранные позиции вместо хранения отдельных копий. Четырёхбитный формат FP4 дополнительно уменьшает кэш до 890 байт на токен. Для постоянного кэша применили SWA Bounded Replay: локальные состояния не сохраняются на SSD, а приблизительно восстанавливаются из последнего окна. Компромисс — небольшая повторная обработка входа и риск ошибок при приближённом восстановлении или выборе позиций.

Решение проверяли в одной мультимодальной модели со смесью экспертов и контекстом до миллиона токенов, сравнивая её с DeepSeek-V4-Flash. Оценка охватывает рассуждение, программирование, агентные задачи и работу с изображениями; в испытанных режимах системного ухудшения возможностей не обнаружили. Однако крайние входы и возобновление работы на границе сохранённого кэша могут проявить ошибки, которых тесты не охватили.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу