Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Oszkár Urbán, Young D. Kwon, Stylianos I. Venieris и Cecilia Mascolo представили AdaptiveSpec — способ ускорить генерацию LLM без дополнительного обучения моделей. В препринте, не проходившем рецензирования, авторы измерили прирост пропускной способности до 56% относительно EAGLE-3. Работа важна командам, которые обслуживают модели через SGLang и оптимизируют задержку при небольшом числе одновременных запросов.
Что сделали
AdaptiveSpec развивает спекулятивное декодирование. При таком подходе небольшая черновая модель заранее предлагает несколько токенов, а основная целевая модель проверяет их параллельно за один проход. Если предложения приняты, система генерирует несколько токенов вместо одного и сокращает число последовательных обращений к целевой модели.
Авторы изменили обе части этого процесса: построение черновых продолжений и их проверку. За основу они взяли EAGLE-3, где черновые токены образуют дерево с несколькими возможными ветвями.
Первое изменение касается проверки. В стандартном варианте предложенный токен принимается только при точном совпадении с выбором целевой модели. AdaptiveSpec при несовпадении сравнивает две вероятности: вероятность чернового токена по оценке целевой модели и вероятность её наиболее предпочтительного токена. Если их отношение превышает заданный порог, черновой вариант принимается. Авторы трактуют близкое отношение вероятностей как признак допустимого расхождения, однако такое правило уже не сохраняет исходное распределение ответов целевой модели.
Второе изменение — динамическая форма чернового дерева. На каждом шаге система объединяет уверенность черновой модели в своём основном варианте с недавней долей принятых токенов. При высокой уверенности дерево становится глубоким и узким: система проверяет длинное продолжение по одной вероятной ветви. При низкой — широким и коротким, чтобы охватить несколько альтернатив. Одновременно меняется общее число черновых токенов, а не только их распределение между глубиной и шириной.
Метод использует сигналы, которые уже возникают при генерации, поэтому отдельный классификатор или дообучение не нужны. Для совместимости с CUDA-графами реализация заранее подготавливает допустимые конфигурации вычислений и переключается между ними во время декодирования.
Что показали
Авторы измеряли пропускную способность — число генерируемых токенов за единицу времени — и сравнивали AdaptiveSpec со статическим EAGLE-3. Средний прирост относительно этого базового метода составлял 18–44% в зависимости от целевой модели.
Качество оценивали как долю точности, сохранённой относительно варианта EAGLE-3 со строгой проверкой токенов. По замерам авторов, AdaptiveSpec сохранял 93–100% этой точности. Результат зависит от порога проверки: более мягкий порог принимает больше несовпадений и повышает пропускную способность, но чаще меняет итоговый ответ.
Авторы также проверяли две части метода отдельно. По их измерениям, динамическое дерево и проверка по отношению вероятностей давали самостоятельный выигрыш, а совместное применение складывало эффекты. Это важно для внедрения: команда может оставить строгую проверку и использовать только адаптацию дерева, если изменение распределения ответов недопустимо.
Ограничения
Эксперименты проводились при пакетной обработке размера 1, жадном декодировании и на одной NVIDIA A100. Такой режим соответствует интерактивному инференсу с минимальной задержкой, но работа не показывает, сохраняется ли выигрыш при высокой параллельной нагрузке, где вычислительный профиль меняется.
Масштаб проверки ограничен тремя целевыми моделями: DeepSeek-R1-Distill-Llama-8B, Llama-3.1-8B-Instruct и Qwen3-8B. В качестве задач использовались GSM8K, MATH-500 и HumanEval, то есть математические рассуждения и генерация кода. Диалоги, извлечение данных, работа с инструментами, длинный контекст и производственные распределения запросов не проверялись.
Порог ослабленной проверки подбирался отдельно для сочетаний модели и набора задач. Поэтому работа не демонстрирует универсальную настройку, которую можно без проверки перенести на другой продукт. Кроме того, авторы прямо указывают, что метод формально не сохраняет распределение целевой модели: сохранение качества подтверждается только выбранными тестами.
Сравнения с TALON и FLy основаны на адаптированных авторами реализациях для SGLang и EAGLE-3, а не на исходных программных стеках этих методов. Диффузионные черновые модели не тестировались. В работе также не измерены стоимость инференса, расход памяти на набор CUDA-графов и время их подготовки.
Что это значит
Работа не требует менять базовую LLM или собирать данные для обучения дополнительного проверяющего модуля. Для команды, уже использующей SGLang и EAGLE-3, AdaptiveSpec выглядит как локальная оптимизация слоя инференса: основные изменения находятся в построении чернового дерева, выборе его конфигурации и правиле принятия токенов.
Планы стоит менять только после замера на собственных запросах. Для интерактивных помощников, генерации кода и других сценариев с небольшой пакетной обработкой имеет смысл добавить AdaptiveSpec в технический эксперимент. Проверять нужно не только среднюю пропускную способность, но и задержку по высоким процентилям, точность прикладных операций и частоту расхождений с текущей системой.
Если продукт требует воспроизводимого распределения ответов или любое изменение токена считается ошибкой, ослабленную проверку внедрять не следует. При этом динамическое дерево остаётся отдельным вариантом оптимизации без намеренного принятия несовпадений. Для систем с высокой пакетной нагрузкой, другими ускорителями или черновыми моделями работа пока не даёт оснований пересматривать инфраструктурный план.
Источники
Иллюстрация: рисунок из статьи «Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding», Oszk\'ar Urb\'an, Young D. Kwon, Stylianos I. Venieris и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



