Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Lightseek выпустила три черновые модели для спекулятивного декодирования Kimi K3: EAGLE-3, DFlash2 и DSpark. Они позволяют проверить разные способы ускорить генерацию в vLLM без повторного обучения основной модели.
При спекулятивном декодировании черновая модель заранее предлагает продолжение, а основная проверяет сразу несколько токенов. Если предположения принимаются достаточно часто, система выдаёт ответ быстрее; если нет, дополнительная модель только расходует вычислительные ресурсы.
Все три модели обучили с помощью TorchSpec и vLLM на NVIDIA GB200. Lightseek также открыла рецепты подготовки данных, поэтому команды могут воспроизвести обучение или адаптировать его под свои задачи.
Пост не приводит замеры ускорения и требований к запуску. Перед внедрением нужно проверить совместимость с используемой версией Kimi K3 и vLLM, условия лицензии, требования к ускорителям и прирост скорости на собственных запросах.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



