Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
При слишком равномерной маршрутизации MoE-модель перестаёт показывать, каких экспертов можно удалить без потери отдельных способностей. Хотя препринт команды Capital One не рецензирован и числа получили сами авторы, предложенный метод MESA обошёл основной альтернативный подход на 7 из 11 проверок. Для команд это означает, что план сокращения модели нужно начинать с диагностики маршрутизации, а не с выбора привычной оценки важности.
Равномерная нагрузка стирает сигнал важности
В модели со смесью экспертов (Mixture-of-Experts) для каждого токена работает только часть блоков-экспертов. Маршрутизатор выбирает эти блоки, поэтому модель использует меньше вычислений, чем плотная архитектура с тем же общим числом параметров. Но все эксперты остаются в памяти, и при развёртывании их часто пытаются сократить целиком.
Обычные методы считают эксперта неважным, если маршрутизатор редко его выбирает или назначает ему малую вероятность. Это работает, пока разные токены действительно тяготеют к разным экспертам. Агрессивная балансировка нагрузки меняет картину: маршрутизатор распределяет вероятность почти поровну, и глобальные оценки становятся похожими.
Авторы предлагают определять такой режим по энтропии маршрутизации — мере равномерности вероятностей внутри каждого токена. Практическим ориентиром служит уровень выше 85% от максимально возможной энтропии. У gpt-oss-20b показатель достиг 90,8%, тогда как у Mixtral-8x7B-Instruct со стандартной маршрутизацией — 74,3%.
При этом слабая специализация не исчезает полностью. Один эксперт может получать немного больше математических токенов, другой — научных или программных. Общая оценка усредняет эти различия и рискует удалить эксперта, который выглядит обычным на всём потоке, но критичен для одного типа задач.
MESA защищает домен с наибольшим ущербом
MESA собирает статистику маршрутизатора отдельно по математике, программированию, естественным наукам, общим знаниям и другим доменам. Затем метод строит предварительный список удаляемых экспертов и проверяет, какая область потеряет наибольшую долю своей маршрутизационной массы.
Эксперты этой области получают прибавку к оценке важности, после чего список пересчитывается. Цикл повторяется, пока алгоритм не найдёт вариант с наименьшим ущербом для худшего домена. Модель не нужно дообучать: расчёт идёт по заранее собранным таблицам вероятностей маршрутизатора.
В главном опыте из gpt-oss-20b удаляли 25% экспертов. MESA показал наименьшее максимальное падение среди доменов и избежал разрыва в 18 процентных пунктов на GPQA, который возник у REAP — метода, учитывающего вероятности маршрутизатора и величину активаций.
Компромисс проявился не только в среднем результате. REAP лучше сохранял соревновательную математику, но сильнее терял знания по естественным наукам. Оценка только по частоте выбора давала обратный профиль. MESA не выигрывал каждую проверку, зато не позволял одной области просесть непропорционально остальным.
Перплексия, то есть средняя неопределённость модели при предсказании следующего токена, в этом режиме вводила в заблуждение. Вариант с самой низкой перплексией хуже всех решал математические задачи, а вариант с самой высокой сохранял их заметно лучше. На Mixtral-8x7B-Instruct такого расхождения не возникло: перплексия и точность ухудшались вместе.
План сокращения модели теперь зависит от маршрутизации
Работа меняет планы команд, которые собираются уменьшать готовую MoE-модель ради памяти и стоимости обслуживания. Перед выбором метода стоит измерить распределение вероятностей для каждого токена. Если оно далеко от равномерного, глобальная частота выбора или оценка по активациям остаются разумной отправной точкой.
Если маршрутизация слишком равномерна, одной общей метрики недостаточно. Потребуется калибровочный набор, разделённый по важным для продукта областям, и проверка качества на задачах из каждой области. Средний балл может скрыть потерю способности, ради которой модель вообще разворачивают.
MESA особенно уместен, когда продукт должен одновременно сохранять рассуждение и предметные знания: например, в помощнике для инженеров или аналитической системе. Если один домен заведомо важнее остальных, команде может подойти специализированная оценка, которая сознательно принимает потери в других задачах.
Основные сравнения проведены на gpt-oss-20b при удалении четверти экспертов; Mixtral-8x7B-Instruct использовали как модель со стандартной маршрутизацией. В дополнительных опытах проверяли перенос подхода на другие размеры и архитектуры, однако при удалении половины экспертов преимущество MESA уже не сохранялось стабильно. Метод стоит рассматривать как способ аккуратного сокращения, а не как разрешение на произвольную глубину компрессии.
Источники
Иллюстрация: рисунок из статьи «When Load-Balancing Goes Too Far: Expert Pruning in Over-Dispersed Mixture-of-Experts Models», Berkcan Kapusuzoglu, Connor Pryor, Sangwoo Cho и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



