Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Черновую модель для спекулятивной генерации можно обучать так, чтобы основная LLM принимала больше предложенных токенов за одну проверку. Tianhua Xia и коллеги показали, что WTV стабильно обходит обучение по KL при выборке токенов, хотя препринт не рецензирован и числа в нём получили сами авторы. Командам придётся выбирать функцию потерь под режим генерации, а не использовать одну для всех вариантов.
Почему совпадения распределений недостаточно
При спекулятивной генерации небольшая черновая модель предлагает серию следующих токенов. Основная модель проверяет их за один проход и принимает токены до первой ошибки. Чем длиннее принятая серия, тем реже приходится запускать дорогую проверку.
Обычно черновую модель учат приближать распределение основной модели через дивергенцию Кульбака — Лейблера, или KL. Эта цель подходит для переноса знаний, но лишь косвенно связана с длиной принятой серии. Небольшая модель расходует ограниченную ёмкость на совпадение всего распределения, хотя для конкретного способа проверки важна только его часть.
При жадной генерации основная модель всегда выбирает самый вероятный токен. Черновой токен пройдёт проверку, только если совпадёт с этим выбором. При выборке механизм другой: вероятность принятия зависит от того, насколько пересекаются распределения двух моделей после применения температуры.
Из этого следует, что единая функция потерь решает две разные задачи. Совпадение наиболее вероятного токена важно для жадного режима, а совпадение вероятностной массы — для выборки.
Как функция потерь учитывает всю принятую серию
Для жадной генерации предложена EAL — функция потерь по ожидаемой длине принятия. Она берёт вероятность правильного токена в начале окна, затем вероятность принять первые два токена подряд и продолжает так до конца окна. Ранние позиции получают особое значение: ошибка на них обрывает проверку и лишает смысла все последующие предложения.
EAL считают на последовательностях, которые сгенерировала замороженная основная модель. Черновая модель видит правильный префикс и учится повышать вероятность токена, который выбрала основная. В экспериментах EAL добавляли к KL, а не использовали как полную замену.
Для выборки введена WTV — функция потерь по полной вариации в окне. На каждой позиции она измеряет пересечение распределений основной и черновой моделей с учётом температуры. Затем объединяет позиции последовательно: вклад дальнего токена учитывается только вместе с вероятностью принять все предыдущие.
Обе функции можно считать параллельно по всей обучающей последовательности, сдвигая окно на одну позицию. Дополнительная стадия GRPO использует смоделированную длину принятия как награду и сравнивает текущую черновую модель с её замороженной копией.
Для выборки результат меняет план обучения, для жадного режима — уточняет его
Для Qwen3-32B с Qwen3-4B и древовидным черновиком при жадной генерации KL дал среднюю длину принятия 5,057 токена. Добавление EAL подняло её до 5,073, а стадия GRPO — до 5,088. При верхней из двух проверенных температур WTV дала 6,671 против 5,960 у KL.
Та же картина повторилась с другими конфигурациями: EAL давала небольшой стабильный выигрыш при жадной проверке, а преимущество WTV становилось заметнее при выборке. Цепочечное и древовидное формирование черновика не изменили общий вывод.
Проверка охватила пары моделей Qwen3 и Gemma4, а также MT-Bench, GSM8K, HumanEval, LongWriter и STEM QA. Сравнивали жадную генерацию и выборку при двух температурах. Основной метрикой была длина принятой серии, а не задержка ответа: фактическое ускорение также зависит от расходов на черновую модель, оборудования и реализации проверки.
Если продукт использует выборку, функцию потерь стоит привязать к рабочей температуре и проверить WTV до смены архитектуры черновой модели. Для жадного режима результаты не дают такого же основания перестраивать конвейер: прибавка от EAL мала, поэтому её нужно сопоставить со стоимостью повторного обучения.
Работа также делает режим генерации частью спецификации обучения. Если сервис переключается между жадной генерацией и выборкой, один универсальный контрольный вариант черновой модели может оказаться хуже двух специализированных. Решение следует принимать по сквозным замерам задержки, сохраняя длину принятия как диагностическую метрику.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



