Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Проект vLLM сообщил со ссылкой на NVIDIA RTX Spark об ускорении локального запуска моделей на новом оборудовании. Производительность выросла на 20% на RTX PRO 6000 Blackwell и до 40% в кластере из двух DGX Spark, однако эти результаты нельзя напрямую переносить на другие GPU или конфигурации.
Значения 1,2 и 1,4 раза описывают две конкретные аппаратные схемы. Второй результат — верхняя граница для пары DGX Spark, а не гарантированный прирост при объединении любых двух узлов.
В исходном посте не указаны модель, точность вычислений, версия vLLM и другого ПО, а также отдельно не раскрыты пропускная способность и задержка ответа. Поэтому цифры показывают потенциал оптимизаций на Blackwell и DGX Spark, но пока не позволяют пересчитать число GPU, стоимость обслуживания или время ответа в конкретном продукте.
Для команд, которые уже выбрали это оборудование, результат даёт основание повторить замер на своей нагрузке. Для остальных это сигнал об улучшении vLLM на отдельных платформах NVIDIA, а не универсальный коэффициент производительности.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



