Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Sol-H3 сгенерировал пятисекундное видео MiniMax-H3 за 1,653 секунды на системе с восемью NVIDIA B300. Команда NVIDIA Sol объединила сокращённую диффузию и оптимизации всего движка, поэтому результат нельзя приписать одному методу ускорения.
Профиль перешёл границу «быстрее воспроизведения» для готового ролика с разрешением 1344×768, частотой 24 кадра в секунду и стереозвуком. Это сокращает задержку пакетной генерации, но пока не доказывает, что модель способна непрерывно выдавать видеопоток в реальном времени.
Четыре прохода DiT убирают основную часть вычислений
Базовый профиль MiniMax-H3 использует 50 точек планировщика и 49 запусков диффузионного трансформера DiT. На каждом таком проходе модель уточняет внутреннее представление будущего ролика. Sol-H3 оставляет четыре прохода, то есть вызывает самую дорогую часть модели примерно в 12 раз реже.
Для пятисекундного ролика полное время сократилось с 18,250 до 1,653 секунды. На более длинных роликах ускорение доходит примерно до 15 раз, поскольку постоянные накладные расходы занимают меньшую долю общего времени.
Однако это сравнение одновременно меняет число проходов и движок выполнения. В опубликованном профиле нет промежуточных замеров четырёхшаговой модели без оптимизаций Sol-Engine или базовой модели на новом движке, поэтому точно разделить вклад двух факторов нельзя.
Движок ускоряет внимание, обмен между GPU и декодирование
Sol-H3 применяет динамическое разреженное внимание: модель обрабатывает не все возможные связи между элементами видео, а выбранную часть. Метод не требует повторно обучать MiniMax-H3. На нескольких GPU движок также передаёт между ускорителями данные пониженной точности в форматах INT8 и FP8, чтобы сократить объём обмена.
Другие операции объединены в составные вычислительные ядра. Это уменьшает число отдельных запусков на GPU для нормализации, позиционного кодирования RoPE, многослойного перцептрона и подготовки разреженного внимания. Параметры AdaLN, которые можно вычислить заранее, движок сохраняет и повторно использует.
Отдельно ускорен декодер VAE, который превращает внутреннее представление модели в кадры и звук. Параллельная пакетная обработка сократила этот этап с 7,55 до 0,602 секунды. Оптимизации также освобождают около 24 ГБ памяти на каждом GPU, что может дать больше места для самого ролика, пакетной обработки или других частей сервиса.
Замер охватывает кодирование запроса, работу DiT и декодирование видео и аудио. В него не входят загрузка модели, предварительная компиляция и финальная упаковка в MP4. Поэтому 1,653 секунды — задержка уже прогретого вычислительного контура, а не полное время от запуска сервиса до получения файла клиентом.
Что это меняет для команд, которые строят продукты на MiniMax-H3
Главный результат привязан к системе с восемью NVIDIA B300. На одной B300 тот же пятисекундный ролик генерируется за 13,745 секунды — почти втрое дольше его воспроизведения. Значит, режим быстрее реального времени требует нескольких ускорителей и сам по себе не переносится на одиночный сервер.
Sol-H3 прежде всего интересен продуктам, где уже используют MiniMax-H3 и допускают модели с малым числом шагов. Совместимые few-step LoRA можно подключить к тому же движку: адаптация меняет поведение модели, но сохраняет короткий профиль диффузии. Код распространяется под Apache 2.0, а готовый вариант доступен через Reactor API.
Для интерактивного редактора или генерации коротких ответов задержка меньше длительности ролика меняет архитектурные ограничения: следующий фрагмент можно подготовить до завершения воспроизведения предыдущего. Для непрерывного видеопотока этого замера недостаточно — ролик создавался целиком, а финальное кодирование не учитывалось.
Практический вывод уже уже: Sol-H3 показывает, что MiniMax-H3 можно ускорять не только заменой внимания или отдельным ядром. Результат складывается из малого числа проходов DiT, сокращённого обмена между GPU и быстрого декодера. Командам следует оценивать этот стек как единый профиль под конкретное число B300, а не как универсальное пятнадцатикратное ускорение любой конфигурации.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



