Журнал · Rit.work

Коактивация экспертов ускорила декодирование MoE на 21%

Apple изменила обучение маршрутизатора MoE, чтобы соседние токены обращались к одним экспертам и реже переносили веса из памяти при спекулятивном декодировании.

Rit.work
Студия разработки
22 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модели со смесью экспертов (MoE) можно обучить так, чтобы они быстрее проверяли предложенные токены и реже упирались в пропускную способность памяти. В препринте Apple, который не прошёл рецензирование, а все числа в нём получили сами авторы, итоговая модель обошла обычную MoE по пропускной способности на 21% при сопоставимом качестве. Это позволяет заложить оптимизацию спекулятивного декодирования в обучение модели, не меняя алгоритм при эксплуатации.

При спекулятивном декодировании небольшая модель предлагает несколько следующих токенов, а целевая проверяет их параллельно. У плотной модели проверка использует один набор весов. В MoE соседние токены могут обратиться к разным экспертам, поэтому ускорителю приходится переносить из DRAM больше весов; чем шире окно проверки, тем сильнее этот эффект.

Apple изменила обучение маршрутизатора, который распределяет токены между экспертами. Нагрузка балансируется глобально по всему пакету, часть экспертов работает для каждого токена, а дополнительная функция потерь сближает решения маршрутизатора для соседних токенов. Авторегрессионный выбор также сохраняет не менее трёх из четырёх экспертов предыдущего токена, поэтому каждый следующий токен добавляет не более одного нового.

В эксперименте использовали модель примерно на миллиард параметров: активными при обработке оставались 353 миллиона. Маршрутизатор выбирал четырёх из 16 экспертов. Совместное применение всех изменений давало лучшую пропускную способность при каждом размере окна проверки; отдельный авторегрессионный выбор немного ухудшал качество, но остальные изменения компенсировали потерю.

Модели обучали с нуля на шести триллионах токенов. Качество проверяли на Wikipedia, OpenWebText2 и GitHub, а также на задачах с ответами на вопросы; сравнивали с плотными моделями и обычными MoE при близком числе активных параметров. Вывод относится к сценарию, где веса экспертов помещаются в DRAM, а скорость ограничивает их перенос в ускоритель.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу