Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Нормализация входных окон может лишить смесь экспертов признаков, по которым она выбирает подходящий адаптер для временного ряда. В препринте Hung Phan и соавторов, который не рецензирован и содержит замеры самих авторов, маршрутизация по исходным данным снизила среднеквадратичную ошибку относительно фиксированного адаптера на 26–79%. Для архитектур с нормализацией каждого окна это меняет место маршрутизатора, но пока не доказывает, что базовая модель полезнее простого алгоритма на исходном ряду.
Нормализация убирает признаки режима до маршрутизатора
Базовая модель временных рядов обычно работает как общий извлекатель признаков. Её параметры замораживают, а под конкретную задачу обучают небольшой адаптер, который превращает скрытые представления в прогноз. Такой подход позволяет держать общую модель в памяти и заменять только компактные модули для разных наборов данных.
Один адаптер применяет одинаковое правило к спокойному участку, устойчивому тренду и резкому скачку. Смесь экспертов должна исправить это: маршрутизатор выбирает для каждого окна специализированный адаптер. Но в моделях семейства MOMENT перед кодировщиком стоит RevIN — слой, который вычитает среднее окна и делит значения на его масштаб.
Эта операция помогает модели работать со сдвигами распределения, но одновременно скрывает амплитуду и средний уровень ряда. Если именно они отличают режимы, маршрутизатор по скрытым представлениям больше не видит основания для выбора. Вероятности быстро сосредотачиваются на одном эксперте, остальные перестают получать градиенты и обучаться.
Авторы проверили альтернативные объяснения через балансировку нагрузки, штрафы для маршрутизатора, другие правила выбора экспертов и несколько вариантов нормализации. Меры, которые обычно исправляют схлопывание смеси экспертов, оставили большую часть разрыва: проблема возникала до оптимизации, во входе маршрутизатора. Рассчитанное до обучения отношение удаляемого сигнала к сохраняемой форме ряда предсказывало риск схлопывания с корреляцией −0,88.
RR-MoA разделяет прогноз и выбор адаптера
В RR-MoA данные идут по двум путям. Замороженная базовая модель по-прежнему строит скрытые представления для адаптеров, поэтому её устройство менять не требуется. Маршрутизатор при этом читает исходное окно до RevIN и сохраняет доступ к уровню, масштабу, волатильности и форме сигнала.
Маршрутизация остаётся разреженной: для каждого окна работает только часть пула адаптеров. В основной конфигурации вычисления экспертов составляли 40% от варианта, где запускался бы весь пул. Значит, исправление не требует полного параллельного выполнения всех адаптеров, хотя проход через саму базовую модель остаётся обязательным.
RR-MoA выиграл все 54 сравнения с лучшим фиксированным адаптером при разных наборах данных и уровнях разморозки MOMENT. Замороженный вариант также обошёл полное дообучение на 12–79% по среднеквадратичной ошибке. Авторы называют это парадоксом замороженной модели: после разморозки градиенты активного эксперта перестраивают кодировщик под него, что усиливает схлопывание вместо адаптации.
Механизм проверяли на семействах ETT, Weather и Electricity, а также на восстановлении пропущенных значений. Сравнение охватило шесть базовых моделей с RevIN, RMSNorm, LayerNorm или без нормализации каждого окна. На Timer-XL без RevIN обычная маршрутизация не схлопывалась и часто работала лучше, поэтому RR-MoA нельзя считать универсальной заменой любой смеси экспертов.
Архитектуру стоит менять только после проверки пользы базовой модели
Работа меняет планы команд, которые ставят смесь адаптеров поверх TSFM с RevIN или похожей нормализацией. Маршрутизатор в такой системе не стоит подключать только к скрытым состояниям. Сначала следует сравнить маршрутизацию до и после нормализации, проверить распределение нагрузки между экспертами и отдельно измерить качество при замороженном кодировщике.
Полное дообучение также перестаёт быть очевидным следующим шагом. Если после разморозки один эксперт забирает все окна, дополнительные вычисления ухудшают специализацию. Практичнее сначала оставить кодировщик неизменным и обучать маршрутизатор вместе с адаптерами на исходном сигнале.
Однако базовый RR-MoA уступал DLinear, простой линейной модели на исходном ряду, на 33–75%. Это существенная граница результата: работа убедительно чинит маршрутизацию адаптеров, но сама по себе не подтверждает преимущество скрытых представлений TSFM. Расширенный Residual-IA+, который даёт экспертам прямой доступ и к исходному ряду, и к признакам кодировщика, сравнялся с DLinear или обошёл его в пяти из шести основных наборов.
Поэтому решение зависит от уже выбранной платформы. Для системы с общей замороженной TSFM и сменными адаптерами перенос маршрутизатора к исходному входу выглядит локальным изменением без переделки кодировщика. Если архитектура ещё не зафиксирована, сначала нужен контрольный эксперимент против DLinear и модели без TSFM: в части замеров вклад базового кодировщика оказался небольшим и зависел от набора данных.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



