Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Длинный контекст удалось обслуживать с меньшим расходом памяти. DeepSeek представила DeepSeek-V4.1-Flash: кэш ключей и значений (KV-кэш), который хранит промежуточное состояние внимания, занимает в GPU-памяти в четыре раза меньше, а на SSD или в памяти сервера — в восемь раз меньше, чем у DeepSeek-V4-Flash; препринт не рецензирован, и все числа в нём получила сама команда. Для систем с частыми вызовами инструментов это снижает требования не только к памяти, но и к переносу сохранённого контекста.
Архитектура CED делит модель на причинный энкодер и декодер. При первичной обработке запроса основную работу выполняет нижняя половина сети, а верхняя получает глобальный кэш из результатов энкодера. Поэтому на входных токенах модель активирует вдвое меньше параметров, чем при генерации ответа, — полезный режим для агентов, которые постоянно дописывают историю и повторно обрабатывают длинные запросы.
CSA2 позволяет слоям повторно использовать глобальные ключи, значения и выбранные позиции вместо хранения отдельных копий. Четырёхбитный формат FP4 дополнительно уменьшает кэш до 890 байт на токен. Для постоянного кэша применили SWA Bounded Replay: локальные состояния не сохраняются на SSD, а приблизительно восстанавливаются из последнего окна. Компромисс — небольшая повторная обработка входа и риск ошибок при приближённом восстановлении или выборе позиций.
Решение проверяли в одной мультимодальной модели со смесью экспертов и контекстом до миллиона токенов, сравнивая её с DeepSeek-V4-Flash. Оценка охватывает рассуждение, программирование, агентные задачи и работу с изображениями; в испытанных режимах системного ухудшения возможностей не обнаружили. Однако крайние входы и возобновление работы на границе сохранённого кэша могут проявить ошибки, которых тесты не охватили.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



