Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Самую затратную часть черновой генерации LLM удалось выполнять одновременно с проверкой основной моделью, не возвращая пакет запросов к последовательной обработке при неудачном прогнозе. В препринте, который не прошёл рецензирование и приводит числа из замеров самих авторов, DPara ускорил Qwen3-8B в среднем в 3,21 раза, а Qwen3-14B — в 3,52 раза относительно обычного авторегрессионного декодирования. Для собственного контура вывода это повод пересмотреть не модель, а расписание вычислений и роль отдельного ускорителя для черновика.
Почему прежняя параллельная схема иногда останавливалась
При спекулятивном декодировании небольшая черновая модель предлагает сразу блок токенов. Основная модель проверяет его одним проходом, принимает подходящее начало и добавляет итоговый токен. Такая проверка сохраняет распределение ответов основной модели, поэтому ускорение не требует менять её вывод.
Черновые модели семейства DSpark делят работу на две части. Диффузионная основа одновременно рассчитывает представления для нескольких будущих позиций, а лёгкая авторегрессионная головка учитывает зависимости между соседними токенами. Черновик получается точнее, но его основа всё равно выполняется перед проверкой и остаётся на критическом пути — в цепочке операций, которая определяет задержку ответа.
Прежние варианты параллельного спекулятивного декодирования запускали следующий черновик во время текущей проверки. Для этого им приходилось заранее угадывать, где закончится принятое начало и какой токен вернёт основная модель. Если прогноз не совпадал с результатом хотя бы для одного запроса, весь пакет снова строил черновик последовательно. У SSD при крупном пакете доля таких возвратов доходила до 96% шагов.
Как DPara готовит продолжение без знания результата
DPara не пытается угадать один исход проверки. Пока основная модель оценивает текущий блок, диффузионная основа заранее рассчитывает представления для каждой возможной границы принятого начала. Дополнительный токен при этом остаётся неизвестным.
После проверки система выбирает уже готовую ветвь, которая соответствует фактической границе. Лёгкая авторегрессионная головка добавляет полученный токен и быстро выпускает следующий черновой блок. На критическом пути остаётся только эта головка: дорогой проход основы уже завершился параллельно с проверкой.
Для такого расписания обычный DFlash не подходил: он ожидал одну опорную позицию с готовыми признаками основной модели. Авторы превратили его в M-DFlash, который за один проход работает с несколькими опорными токенами без таких признаков и изолирует ветви друг от друга маской внимания.
M-DFlash обучали из опубликованной контрольной точки DSpark. Меняли только диффузионную основу, а авторегрессионную головку и основную модель оставили замороженными. Новые обучаемые параметры не добавляли, однако для каждой целевой модели всё равно нужен адаптированный черновик.
Когда результат меняет планы инфраструктуры
DPara проверили на Qwen3-8B и Qwen3-14B в семи наборах задач по математике, программированию и диалогам. В сравнение вошли обычное декодирование, последовательный DSpark и параллельные PEARL и SSD. Основные замеры провели на NVIDIA H800, выделив отдельный GPU для черновой модели; дополнительные опыты использовали GB200 и A10.
DPara оказался быстрее всех вариантов на каждой паре модели и набора данных. Относительно DSpark среднее преимущество составило 11,1% для меньшей Qwen3 и 5,1% для большей. Выигрыш сохранился при пакетах вплоть до 16 запросов: пропускная способность оставалась более чем вдвое выше обычного декодирования, хотя относительное ускорение снижалось вместе с ростом пакета.
Отдельный GPU не обязательно должен совпадать по классу с ускорителем основной модели. В конфигурации с H800 для проверки и A10 для черновика система сохранила около 98% ускорения основной конфигурации. Для этого вычисление словарных оценок и авторегрессионную головку перенесли на H800, а между устройствами передавали компактные скрытые представления.
Размещение обеих частей на одном GPU тоже работало при небольших пакетах, но с ростом нагрузки основа черновика начинала конкурировать с основной моделью за вычислительные блоки и пропускную способность памяти. Тогда преимущество перед DSpark исчезало.
Работа меняет планы команд, которые самостоятельно обслуживают Qwen3-подобные модели, контролируют среду выполнения и оптимизируют задержку. Вместо замены основной LLM можно проверить, удастся ли спрятать основу черновика внутри окна проверки и вынести её на более слабый ускоритель. Для сервисов через внешний API схема неприменима напрямую: она требует доступа к внутренним признакам модели, собственному планировщику и обучению черновой основы.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



