Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
LightSeek выпустила три черновые модели для Kimi K3: EAGLE-3, DFlash2 и DSpark. Их обучили через TorchSpec, проверили вместе с vLLM и дополнили открытыми рецептами подготовки данных и обучения.
Коллекция позволяет не разрабатывать ускоритель генерации с нуля, но выбор модели зависит от нагрузки: DFlash2 лучше работает при небольшой параллельности, а преимущество перед EAGLE-3 сокращается по мере роста пакета запросов.
Черновая модель предлагает токены, а Kimi K3 их проверяет
При спекулятивной генерации небольшая модель заранее строит продолжение из нескольких токенов. Основная Kimi K3 проверяет весь блок и принимает корректную начальную часть; после первого расхождения остаток отбрасывается.
Ускорение возникает, когда одна проверка заменяет несколько последовательных шагов основной модели. Качество чернового продолжения измеряют средней длиной принятой части: чем она больше, тем реже Kimi K3 приходится продолжать генерацию самостоятельно.
DFlash2 показала лучший средний результат — 4,02 принятого токена. У DSpark показатель составил 3,49, у EAGLE-3 — 2,91. При этом большая длина принятого продолжения не гарантирует максимальную скорость: основная модель всё равно тратит ресурсы на проверку ошибочных токенов.
Для Kimi K3 эта цена особенно заметна. Модель использует разреженную смесь экспертов, поэтому дополнительные позиции увеличивают вычисления и обмен данными между экспертами. Гибридная архитектура внимания также должна продвигать и откатывать внутреннее состояние для каждого предположенного токена.
DFlash2 выигрывает на коротких очередях, EAGLE-3 — на растущих пакетах
DFlash2 предлагает более длинные блоки. При небольшой параллельности это сокращает число последовательных запусков Kimi K3 и даёт ей преимущество перед EAGLE-3.
Когда пакет превышает 32 запроса, дополнительные проверки начинают стоить дороже, чем принятые токены экономят. Более короткое окно EAGLE-3 создаёт меньше бесполезной работы, поэтому разрыв между моделями сокращается. Для сервиса с постоянно заполненной очередью средняя длина принятого продолжения становится менее полезной метрикой, чем сквозная пропускная способность.
DSpark заняла промежуточное положение, но её контрольную точку обучали меньше из-за ограничений ресурсов. Кроме того, замер провели без динамической проверки, которая сокращает затраты на заведомо неверные предположения. Поэтому прямое сравнение с DFlash2 пока отражает не только архитектуру, но и разную зрелость обучения и исполнения.
Все три модели применяют многолатентное внимание (MLA), которое уменьшает KV-кэш. DFlash2 сочетает внимание со скользящим окном и полное внимание, а DSpark использует полное внимание во всех своих слоях. LightSeek выбрала окно для DFlash2 после того, как полное внимание DSpark стало узким местом на длинном контексте.
Что это меняет для команд, которые строят генерацию на Kimi K3
Коллекция превращает выбор черновой модели из исследовательской задачи в проверку на собственном профиле нагрузки. Для интерактивного продукта с небольшой очередью первым кандидатом становится DFlash2. Для пакетной обработки и высокой параллельности нужно отдельно сравнить её с EAGLE-3 по сквозной скорости, а не выбирать по числу принятых токенов.
Воспроизведение начинается с опубликованного набора из 300 тысяч заново сгенерированных примеров. Рецепты рассчитаны на контекст до 64 тысяч токенов и разделённый режим: vLLM запускает основную Kimi K3 и производит скрытые состояния, а TorchSpec обучает по ним черновую модель.
Исходная конфигурация использовала 40 NVIDIA GB200. Поскольку Kimi K3 не помещается на небольшом числе ускорителей, авторы разделили её веса конвейерным параллелизмом и передавали скрытые состояния в обучающий контур асинхронно. Это уменьшает простои между исполнением основной модели и обновлением черновой.
В TorchSpec также сгруппировали последовательности по длине, убрали блокирующую синхронизацию CPU с GPU и заменили отдельные операции оптимизатора объединёнными. Вместе эти изменения ускорили обучение в 2,5 раза. Для EAGLE-3 авторы стали выбирать случайные опорные токены вместо построения продолжения от каждой позиции; на самых длинных проверенных последовательностях вычисление внимания ускорилось в 31,7 раза.
После обучения контрольная точка подключается к Kimi K3 через механизм спекулятивной генерации vLLM. Практический выбор сводится к двум замерам на реальном трафике: сколько токенов основная модель принимает и какую итоговую пропускную способность даёт связка при рабочей параллельности.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



