Журнал · Rit.work

KV-streams ускоряет обучение LLM-агентов без повторного расчёта контекста

KV-streams сохраняет KV-кэш после сжатия контекста и ускоряет обучение LLM-агентов в 2,6–5 раз без заметного ухудшения результата.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Обучение LLM-агентов на длинных траекториях ускорили, сохранив вычисленное состояние после сжатия контекста. В нерецензированном препринте команды из Mila, Microsoft и нескольких университетов сами авторы получили ускорение в 2,6–5 раз без заметного ухудшения итоговых оценок. Это позволяет дольше обучать агентов при прежнем бюджете GPU, если основную нагрузку создаёт повторная обработка сохранённого контекста.

Обычно система сокращает переполненный контекст, оставляет последние сообщения или резюме, а затем заново пропускает их через модель. KV-streams вместо этого переносит вперёд кэш ключей и значений (KV-кэш), уже рассчитанный для сохранённых токенов. На стороне обучения маска внимания закрывает удалённые фрагменты, поэтому модель продолжает одну траекторию и не вычисляет прежние токены повторно.

Выигрыш зависит от того, как часто система сжимает контекст и какую его долю сохраняет. Чем больше оставшийся фрагмент, тем дороже обычное повторное заполнение кэша и тем полезнее KV-streams. При этом потоковый кэш сохранял сведения, которые уже исчезли из видимого контекста: в отдельном управляемом опыте модель научилась извлекать их только через обучение с подкреплением, без предварительного обучения на готовых ответах.

Метод проверили на Qwen3-4B-Instruct-2507 и Qwen3.5-4B в TextWorld, ALFWorld и задачах разработки из SWE-bench Verified. Его сравнивали с полным контекстом и четырьмя способами сжатия, которые заново заполняют кэш. Для TextWorld и задач разработки провели по одному запуску, поэтому вывод о сохранении качества там слабее, чем результат ALFWorld с несколькими запусками.

Интеграция требует изменений и в сервере вывода, и в обучающем контуре. В варианте на vLLM кэш хранился блоками по 16 токенов, поэтому завершения приходилось дополнять до границы блока; без этого поток разрывался и качество заметно падало. В реализации на SGLang использовали блок размером в один токен, и дополнение не понадобилось.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу