Журнал · Rit.work

MoE-модели научили учитывать кеш экспертов после обучения

Новые кеш-роутеры сокращают перенос весов между памятью и GPU, но требуют совместного пост-обучения модели и пока не доказывают прирост скорости.

Rit.work
Студия разработки
7 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

MoE-модель научили реже переносить веса экспертов из медленной памяти на GPU, сохранив штатный выбор экспертов при генерации. Хотя препринт Zhenhe Wu и соавторов не рецензирован и числа получили сами авторы, новый метод обошёл лучший из проверенных вариантов с упреждающей загрузкой на всех задачах для Qwen3. Для команд, которые выгружают экспертов из GPU, управление кешем становится частью пост-обучения модели, а не только настройкой среды выполнения.

Модель учится оставлять в кеше нужных экспертов

MoE-модель содержит много блоков-экспертов, но для каждого токена запускает лишь несколько. Штатный роутер ранжирует экспертов и выбирает верхние Top-K. Если все веса не помещаются в память GPU, недостающие приходится загружать перед вычислением, а затем решать, какие из них оставить в ограниченном кеше.

Обычные политики вроде LRU сохраняют недавно использованные веса, не зная, какие эксперты понадобятся модели дальше. Предложенный Temporal Router получает скрытое состояние текущего токена и оценивает спрос на экспертов в том же слое для следующего токена. После вычисления он объединяет этот прогноз с оценками штатного роутера и оставляет в кеше веса с наивысшим приоритетом.

Temporal Router ничего не загружает заранее. Если нужного эксперта не оказалось в кеше, система переносит его по требованию, выполняет слой и только затем обновляет состав кеша. Такой режим не создаёт дополнительный трафик из-за ошибочного прогноза.

Spatio-Temporal Router добавляет второй этап перед обращением к слою. Он использует уже доступное скрытое состояние предыдущего слоя или последнего слоя предыдущего токена, уточняет состав кеша и может заранее загрузить ограниченный набор кандидатов. Бюджет уточнения задаётся при запуске и меняется без повторного обучения.

Оба режима оставляют за штатным роутером окончательный выбор исполняемых экспертов. Однако его параметры не замораживают: при пост-обучении модель одновременно минимизирует языковую ошибку и учится направлять токены так, чтобы будущие обращения чаще попадали в кеш. Когда обучали только вспомогательные роутеры, качество ответов сохранялось, но кеш выигрывал заметно меньше.

Трафик считали вместе с ошибочными загрузками

Метод проверяли на Qwen3 и GPT-OSS в задачах GSM8K, MATH и CommonsenseQA. Для сравнения взяли классические политики вытеснения и методы, которые прогнозируют будущих экспертов. Каждый вариант работал как полная конфигурация со своим адаптированным маршрутом, поэтому результаты не описывают разные кеши на одной неизменной последовательности обращений.

Главные показатели — доля обращений, для которых вес уже находился на GPU, и объём перенесённых весов на токен. Для методов с упреждающей загрузкой ввели скорректированную долю попаданий: она учитывает, что неверный прогноз сам создаёт трафик и может вытеснить полезный вес.

На Qwen3 полный Spatio-Temporal Router повысил скорректированную долю попаданий на 1,15–18,03 процентного пункта и сократил трафик на 4,6–53,3% относительно лучшего проверенного метода с упреждающей загрузкой. Temporal Router стабильно превосходил сопоставимые варианты без упреждающей загрузки. На GPT-OSS результат зависел от задачи, поэтому преимущество не переносится автоматически между архитектурами.

Вспомогательные роутеры добавили не более 0,083% параметров во время вывода. Но этот показатель скрывает основную цену метода: лучшие результаты потребовали обучать всю модель, а не только небольшие новые слои.

В планах появляется пост-обучение, но не замена среды выполнения

Работа меняет план эксперимента, если узкое место уже связано с переносом весов экспертов. Вместо перебора только LRU, частотных политик и планировщиков можно добавить кеш-зависимую цель в пост-обучение и проверить, способна ли сама модель создавать более предсказуемую последовательность обращений.

Начинать рациональнее с Temporal Router: он не загружает веса по прогнозу и потому не обменивает пропуски кеша на лишние переносы. Полный режим подходит, когда важнее подготовить экспертов до обращения к слою. Его бюджет уточнения нужно выбирать по трафику с учётом упреждающих загрузок, а не по обычной доле попаданий: более широкий прогноз повышал этот показатель, но мог увеличить общий перенос весов.

Считать метод готовым способом ускорить сервис пока нельзя. Эксперименты моделировали трафик только на этапе генерации и не измеряли задержку или пропускную способность всей системы. Реальный результат зависит от пропускной способности памяти, пакетной обработки, планирования и того, насколько хорошо вычисления перекрывают перенос данных.

Проверка охватывала чистые MoE-модели и академические задачи на рассуждение; для каждой основной модели использовали один фиксированный размер кеша, а его влияние отдельно изучали только на связке Qwen3 и GSM8K. Кроме того, более сильная кеш-зависимая цель концентрировала запросы на меньшем числе экспертов и при чрезмерном весе ухудшала ответы. В распределённой системе такая концентрация может также изменить баланс нагрузки между GPU.

Практический следующий шаг — не менять серверный стек, а провести пост-обучение на целевой модели и измерить одновременно качество, загрузки по требованию, упреждающий трафик и распределение обращений между экспертами. Если перенос весов действительно доминирует, штатное правило Top-K можно сохранить, а кеш сделать частью поведения модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу