Журнал · Rit.work

MoE-модели сохранили качество без трети выбранных экспертов

Равномерное сокращение числа активных экспертов почти не уступило динамическим методам, пока бюджет вычислений не стал жёстким.

Rit.work
Студия разработки
23 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

В мелкозернистых MoE-моделях можно не запускать примерно треть уже выбранных экспертов — специализированных подсетей, которые маршрутизатор назначает каждому токену. Хотя препринт не рецензирован и числа получили сами авторы, такой режим сохранил 98,8% исходного качества и ускорил обработку запросов в 1,2–1,7 раза. Для развёртывания это задаёт простой базовый вариант: сначала уменьшить фиксированное число экспертов, а динамическое распределение добавлять лишь при более жёсткой экономии.

Маршрутизатор ранжирует экспертов для каждого токена. Исследователи отбрасывали нижнюю часть списка, перенормировали веса оставшихся экспертов и не меняли параметры модели. Такое отсечение требует поправить одно целое число в настройке маршрутизации; обязательные общие эксперты при этом продолжали работать.

При умеренном сокращении лучшие динамические правила отличались от фиксированного отсечения меньше чем на один процентный пункт при одинаковом среднем числе экспертов. При агрессивном сокращении они возвращали до 3 процентных пунктов качества. Выигрыш сосредоточился в задачах с генерацией программ и длинных математических решений, где ошибки на отдельных шагах накапливаются.

Проверка охватила 12 контрольных версий из девяти архитектур с разными размерами экспертных пулов и способами маршрутизации. Равномерное отсечение оценивали на вопросах о знаниях, математике, программировании и общих рассуждениях; динамические правила сравнивали на четырёх основных моделях. Скорость замеряли в двух системах запуска при одинаковой пакетной нагрузке и фиксированной длине входа и ответа. Крупные модели и версии, обученные рассуждать, лучше переносили жёсткое отсечение, а мультимодальная модель оказалась чувствительнее.

Практический порядок следует из сравнения: фиксированное число экспертов даёт большую часть экономии без отдельной калибровки. Динамическое распределение оправдывает дополнительную сложность, когда нужно выйти за этот режим и сохранить качество длинных генерируемых ответов.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу