Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Ненужные вызовы экспертов в MoE-моделях научились отсекать по их ожидаемому вкладу, а не только по оценке маршрутизатора. На Qwen3.6-35B-A3B при пропуске 50% вызовов ACE снизил перплексию на 7,96% и поднял среднюю точность на 4,15 процентного пункта относительно лучшего конкурента, хотя препринт не рецензирован и все числа получили сами авторы. Метод позволяет сократить вычисления уже обученной модели, не меняя её веса и исходный маршрутизатор.
Как ACE оценивает важность одного вызова эксперта
Обычная MoE-модель для каждого токена выбирает заданное число лучших экспертов. Маршрутизатор показывает, какому эксперту ближе входной вектор, но не измеряет, насколько сильно эксперт изменит этот вектор. Поэтому два кандидата с похожими оценками маршрутизатора могут внести разный вклад в результат слоя.
ACE сначала строит глобальную оценку преобразующей способности эксперта — GSP. Она учитывает совместную работу матриц входного затвора, расширения и выходной проекции в блоке SwiGLU, а также коэффициенты RMSNorm перед MoE-слоем. Оценки считают по замороженным весам, объединяют геометрическим средним и нормализуют относительно других экспертов того же слоя.
Геометрическое среднее здесь не даёт одной крупной матрице скрыть слабость остального тракта. Высокую оценку получает эксперт, у которого обе ветви SwiGLU и выходная проекция способны вместе дать сильный отклик. Для каждого слоя получается таблица коэффициентов, которую можно подготовить до запуска сервиса.
Одной глобальной оценки недостаточно: эксперт может слабо отвечать в среднем, но хорошо работать в своей узкой области входов. Компонент RCR извлекает такую область из весов маршрутизатора. Для этого он вычитает средний вектор маршрутизации, получает характерное направление каждого эксперта и оценивает отклик эксперта вдоль него.
Во время вывода ACE берёт исходных кандидатов маршрутизатора и для каждого умножает его текущую оценку на два заранее рассчитанных коэффициента. Метод использует более высокую из двух итоговых оценок: вызов пропускают, только если и глобальный, и направленный критерий считают его малозначимым. Лучший кандидат остаётся всегда, а дополнительная проверка не позволяет отбросить экспертов с большой суммарной долей маршрутизации.
В оперативном контуре остаются обращения к таблицам, скалярные умножения и сравнение нескольких кандидатов. Полные проходы через экспертов нужны только тем вызовам, которые пережили отбор.
Преимущество проявилось при жёстком сокращении бюджета
ACE проверили на трёх моделях семейства Qwen и Gemma, а качество измеряли на восьми наборах задач, включая языковое моделирование, рассуждения и код. Для всех методов использовали одинаковую реализацию BF16, одни запросы и фактически достигнутые доли пропуска в диапазоне 10–60%.
При небольшом сокращении простая оценка маршрутизатора иногда работала не хуже: она достаточно хорошо находит явно слабых кандидатов. Разрыв появился, когда пришлось выбирать между экспертами с более заметным вкладом. На Gemma-4 преимущество ACE над отдельной глобальной оценкой выросло до 2,46 процентного пункта на самом жёстком режиме.
Сравнение компонентов подтверждает смысл двойной проверки. GSP оказался сильнее RCR как самостоятельный критерий, поскольку одно направление маршрутизатора не описывает все входы эксперта. Вместе они работали лучше: направленная оценка сохраняла специализированного эксперта, которого глобальный показатель мог ошибочно признать слабым.
Эти результаты относятся к Qwen3-30B-A3B-Instruct-2507, Qwen3.6-35B-A3B и Gemma-4-26B-A4B-it. Порог под требуемый бюджет подбирали на немаркированном рабочем наборе, а каждый опыт запускали один раз, поэтому перенос порога между другими нагрузками отдельно не проверен повторными сериями.
ACE стоит добавлять после выбора MoE, а не вместо него
Метод меняет планы команд, которые самостоятельно обслуживают MoE-модель и контролируют диспетчеризацию экспертов. Он не уменьшает контрольную точку и объём весов в памяти: все эксперты сохраняются. ACE сокращает только число исполненных экспертных блоков для конкретных токенов, поэтому его эффект зависит от того, умеет ли вычислительный контур действительно не запускать отброшенные блоки.
Внедрение состоит из трёх частей. Сначала из весов модели один раз рассчитывают таблицы GSP и RCR. Затем по немаркированному набору рабочих запросов выбирают порог, который даёт нужную долю пропусков. После этого оценки добавляют в диспетчер экспертов и проверяют качество на задачах продукта.
Различие между оценкой вклада и выбором порога существенно. Самим оценщикам не нужны обучающие примеры, сохранённые активации или дообучение. Но для перевода требования «сократить столько-то вызовов» в конкретный порог работа использует проход по немаркированной нагрузке, то есть подготовка развёртывания всё же зависит от доступных запросов.
На NVIDIA A100 оптимизированная диспетчеризация ускорила обработку входного запроса до 2,25 раза, а выпуск следующих токенов — до 1,41 раза. Почти одинаковая задержка у методов с равным числом исполненных экспертов показывает, что выигрыш даёт именно пропуск блоков, а не дешёвый расчёт оценок ACE.
Для плотных моделей и сервисов, где поставщик API не открывает веса и маршрутизацию, подход не применим. Для собственного MoE-контура ACE даёт способ добавить управляемый вычислительный бюджет после обучения, не создавая отдельную версию контрольной точки для каждого режима нагрузки.
Источники
Иллюстрация: рисунок из статьи «ACE: Adaptive Calibration-Free Expert Skipping for MoE-based LLMs», Zukang Xu, Zhixiong Zhao, Xing Hu и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



