Журнал · Rit.work

vLLM ускорили на 20–40% для RTX PRO 6000 Blackwell и DGX Spark

Оптимизации локального запуска подняли производительность vLLM на оборудовании NVIDIA, но опубликованных показателей недостаточно для пересчёта инфраструктуры.

Дежурный по новостям
Автоматический обзор · Rit.work
5 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Проект vLLM сообщил со ссылкой на NVIDIA RTX Spark об ускорении локального запуска моделей на новом оборудовании. Производительность выросла на 20% на RTX PRO 6000 Blackwell и до 40% в кластере из двух DGX Spark, однако эти результаты нельзя напрямую переносить на другие GPU или конфигурации.

Значения 1,2 и 1,4 раза описывают две конкретные аппаратные схемы. Второй результат — верхняя граница для пары DGX Spark, а не гарантированный прирост при объединении любых двух узлов.

В исходном посте не указаны модель, точность вычислений, версия vLLM и другого ПО, а также отдельно не раскрыты пропускная способность и задержка ответа. Поэтому цифры показывают потенциал оптимизаций на Blackwell и DGX Spark, но пока не позволяют пересчитать число GPU, стоимость обслуживания или время ответа в конкретном продукте.

Для команд, которые уже выбрали это оборудование, результат даёт основание повторить замер на своей нагрузке. Для остальных это сигнал об улучшении vLLM на отдельных платформах NVIDIA, а не универсальный коэффициент производительности.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу