Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Редко вызываемый эксперт в модели со смесью экспертов (MoE) не обязательно оказывается лучшим кандидатом на удаление. В препринте Tencent, который не прошёл рецензирование и содержит числа, полученные самими авторами, метод RAZOR показал лучший средний результат во всех проверенных сочетаниях моделей и бюджетов. При сокращении модели теперь имеет смысл оценивать не активность блока, а ущерб, который останется после его удаления.
Частота вызова не показывает, чем занят эксперт
MoE-модель хранит множество специализированных блоков, но для каждого токена запускает лишь несколько из них. Это сокращает вычисления во время ответа, однако все эксперты по-прежнему занимают память. Физическое удаление части блоков уменьшает объём хранимых параметров.
Обычные способы прореживания ранжируют экспертов по частоте вызова, норме их выхода или величине выхода с учётом веса маршрутизатора. Такие показатели отвечают на вопрос, насколько заметно эксперт участвует в вычислении, но не показывают, смогут ли оставшиеся блоки воспроизвести его вклад.
Выход эксперта — вектор, поэтому важен не только его размер, но и направление. Два набора экспертов могут иметь одинаковые веса маршрутизатора и одинаковые нормы выходов, однако наименее вредным для удаления в них окажется разный блок. Авторы доказывают это на скалярном примере: одной информации о частоте и величине вклада недостаточно даже для выбора одного эксперта.
Удаление также меняет работу маршрутизатора. Веса выживших экспертов нормируются заново, а освободившееся место может занять следующий блок из рейтинга маршрутизатора. Новый участник иногда компенсирует удалённый вклад, а иногда сдвигает общий выход ещё сильнее.
Как RAZOR измеряет заменяемость
RAZOR сначала фиксирует исходный взвешенный выход экспертного слоя для каждого калибровочного токена. Затем метод измеряет отклонение выхода каждого выбранного эксперта от этой смеси. Такое отклонение сохраняет информацию и о величине вклада, и о его направлении.
Для каждого эксперта строится локальный контрфактический сценарий: блок удаляют, веса оставшихся нормируют заново, а маршрутизатор подставляет следующего кандидата. Расстояние между исходной смесью и пересобранным выходом показывает ущерб от удаления. Если новый эксперт компенсирует исчезнувший вклад, оценка получается низкой; если его функцию никто не воспроизводит — высокой.
Локальные оценки объединяют по калибровочным токенам, на которых эксперт действительно вызывался. Блоки с высоким ожидаемым ущербом сохраняют, а наиболее заменяемые удаляют в пределах бюджета каждого слоя. Для расчёта нужны только прямые проходы модели: градиенты, перебор наборов и дообучение после удаления не требуются.
Точная формула описывает удаление одного эксперта при неизменном входе слоя. При одновременном удалении нескольких блоков их вклады могут усиливать или гасить друг друга, а кандидат на замену сам может не попасть в итоговую модель. Изменения также распространяются на последующие слои, поэтому локальная точность оценки не гарантирует полного совпадения с исходной моделью.
Для экономии памяти планы меняются, для ускорения — пока нет
RAZOR проверили на GLM-4.7-Flash, Qwen3.6-35B-A3B, DeepSeek-V4-Flash-0731 и Hy3 при удалении 25% и 50% экспертов. По среднему результату на девяти задачах метод занял первое место среди проверенных способов во всех сочетаниях моделей и бюджетов. В сопоставимых запусках на GLM и Qwen он обошёл REAP на 2,12–5,59 балла и выиграл все 36 попарных сравнений по задачам.
Метод также лучше сохранял распределение следующих токенов. Это измеряли через обратную дивергенцию Кульбака: она показывает, насколько распределение ответов сокращённой модели отклонилось от исходного, и чем значение ниже, тем меньше сдвиг. RAZOR превзошёл REAP во всех сопоставимых проверках этой метрики, хотя выигрыш не был одинаковым для каждого домена.
Высокие баллы не означают, что модель ведёт себя как прежде. На свободной генерации Qwen менялись разнообразие ответов, форматирование и причины завершения. При более жёстком удалении RAZOR реже оставлял лишние закрывающие разделители, чем REAP, но чаще исходной модели упирался в предел длины.
Работа поддерживает смену критерия, если команда уже планирует уменьшать MoE ради памяти: частоту вызова и норму выхода стоит заменить или хотя бы дополнить оценкой функциональной заменяемости. Проверка должна включать прикладные задачи, близость распределений и свободную генерацию, поскольку эти три вида результатов расходятся.
Для планов по ускорению вывода оснований меньше. После прореживания маршрутизатор активирует прежнее количество экспертов на токен, а работа оценивает сохранение качества, но не измеряет задержку, энергопотребление и пиковую память. RAZOR предлагает более обоснованный выбор удаляемых блоков, но не доказывает пропорционального ускорения сервиса.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



