Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Параллельные черновые модели для спекулятивного декодирования теперь можно обучать прямо сокращать число дорогих проходов целевой модели. В препринте Yunxiao Zhao и Changxiao Cai, который не прошёл рецензирование и в котором все числа получили сами авторы, средняя принятая длина на отдельных чат-тестах выросла примерно на 3%. Метод можно добавить при дообучении черновика, не меняя его архитектуру и процедуру генерации.
Почему принятые токены внутри блока дают неверную цель
При спекулятивном декодировании небольшая модель предлагает блок токенов, а целевая LLM проверяет их за один проход. Она принимает подходящие токены до первого отказа, после чего сама выбирает исправление и начинает новый раунд. Такая проверка сохраняет распределение ответов целевой модели: черновик влияет на число проходов, но не должен менять качество генерации.
Для авторегрессионного черновика достаточно хорошо предсказывать следующий токен по полному префиксу. Его распределение в конкретной позиции не зависит от того, где начался текущий раунд.
У параллельного или частично авторегрессионного черновика зависимость сложнее. Он строит весь блок от префикса, доступного в начале раунда. Один и тот же токен поэтому получит разные распределения, если предыдущий отказ сдвинул начало блока.
Обычные цели обучения оценивают каждый блок отдельно: сближают распределения моделей или увеличивают ожидаемое число принятых токенов внутри раунда. Они не учитывают, что ранний отказ меняет все последующие точки старта. Из-за этого черновик может улучшить локальный показатель, но не сократить общее число проходов целевой модели.
Главная метрика работы — средняя принятая длина. Она показывает, сколько выходных токенов в среднем приходится на один раунд проверки. Для фиксированной целевой модели увеличить эту длину означает сократить ожидаемое число раундов.
Как EDR связывает отказ с будущими раундами
Авторы описали генерацию как марковский процесс с затратами. Состояние хранит две позиции: где начался текущий раунд и какой токен сейчас проверяют. Если токен принят, проверка движется дальше внутри блока. Если отклонён, система платит стоимость одного нового раунда и переносит его начало за исправленный токен.
Для каждого состояния EDR вычисляет две величины. Первая — вероятность попасть в него при генерации заданной последовательности. Вторая — локальная вероятность отказа, рассчитанная по распределениям черновой и целевой моделей. Ошибки в редко достижимых состояниях получают меньший вес, а ошибки на частых траекториях влияют сильнее.
Сумма локальных затрат с такими весами в точности равна ожидаемому числу раундов декодирования. Это отличает EDR от приближённых целей с заранее выбранными весами для позиций блока. Дополнительные настраиваемые коэффициенты методу не нужны.
Прямое дифференцирование потребовало бы проводить обратное распространение через весь расчёт вероятностей состояний. Вместо этого EDR использует разность ожидаемых будущих затрат соседних состояний. Градиент проходит только через локальную стоимость отказа и вероятность принятия токена, поэтому модель можно обучать на последовательностях, сгенерированных целевой LLM.
Та же схема работает как офлайн-оценщик. Несколько черновиков можно сравнить на общих генерациях целевой модели, не запуская для каждого полноценное спекулятивное декодирование. Парное сравнение убирает шум от разных ответов модели и лучше показывает эффект самой цели обучения.
Кому стоит менять обучение черновика
EDR проверили на DSpark с Qwen3-4B и DFly с Qwen3-8B. Черновики дообучали одну эпоху на Open-PerfectBlend, а затем оценивали на девяти наборах задач по математике, программированию и диалогам. Использовали фиксированный размер блока и те же архитектуры, данные и настройки оптимизатора, что для локальной цели E2E.
После дообучения EDR дал не меньшую среднюю принятую длину во всех сравнениях с E2E. Максимальный показанный разрыв между этими целями составил 0,04 токена на раунд. Результат последовательный, но небольшой: работа предлагает точнее согласованную цель обучения, а не новый класс ускорения.
Командам с параллельным или частично авторегрессионным черновиком имеет смысл проверить EDR вместо локальной функции потерь. Архитектуру и код декодирования менять не требуется, но для обучения понадобятся генерации целевой модели и её распределения следующего токена. Расчёт вероятностей и ожидаемых будущих затрат для нескольких точек старта также делает обучение дороже, чем с локальными целями.
Для обычного авторегрессионного черновика вывод слабее: там EDR сводится к локальному согласованию распределений. Работа также измеряет число раундов и среднюю принятую длину, а не задержку ответа сервера. Выигрыш в проходах целевой модели не обязан в той же пропорции сокращать задержку, поскольку остаются затраты на черновик и проверку длинного блока.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



