Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
TAFAS, COSA, PETSA и DynaTTA проверили так, чтобы они учились только на уже поступивших данных, и на большинстве наборов их преимущество почти исчезло. В препринте EURECOM, который не проходил рецензирование и в котором числа получили сами авторы, устойчивую пользу всех проверенных методов сохранил только ETTm1. Для выбора архитектуры это переносит внимание с устройства адаптера на задержку меток, качество исходной модели и дешёвые линейные корректоры.
Как из проверки убрали данные из будущего
Адаптация модели во время работы (test-time adaptation) обновляет развёрнутую модель или небольшой модуль рядом с ней по мере поступления фактических значений. Проблема возникает, когда модель прогнозирует целое окно вперёд: правильный ответ для конца окна ещё не существует в момент выпуска прогноза.
В старом протоколе адаптеру могли отдать всё целевое окно уже на следующем шаге. Он обучался на значениях, которые в реальной системе появятся лишь позднее, поэтому результат содержал утечку из будущего. Новый стенд разрешает обновление только после того, как окно полностью наблюдалось; дополнительная задержка имитирует передачу показаний, проверку и загрузку данных.
Исправления внесли непосредственно в выпущенный код методов, сохранив их исходные модели и контрольные точки. Механизмы, которые обучаются на уже видимой части незавершённого окна, тоже изменили: при задержке им доступен более короткий фрагмент, а не будущие значения.
Проверка охватила пять наборов: ETTm1, ETTh2, Weather, Electricity и Traffic. Прогноз строили на 24 шага, качество измеряли стандартизованной среднеквадратичной ошибкой, а адаптеры сравнивали с замороженной моделью, переносом последнего значения и сезонным прогнозом. Во внутреннем эксперименте использовали DLinear и PatchTST; опубликованные методы дополнительно запускали на их собственных контрольных точках.
Простые фильтры задали более высокий порог
В качестве контрольного решения работа предлагает банк фильтров рекурсивного метода наименьших квадратов (RLS). Каждый фильтр поправляет прогноз по самому прогнозу, последнему наблюдению и сезонному значению. Фильтры по-разному забывают старые данные, а итог выбирается как медиана их прогнозов вместе с вариантом без коррекции.
Медиана здесь заменяет обучение весов между фильтрами. Если выбирать лучший фильтр по прошлой ошибке, задержка метки заставляет систему продолжать использовать уже испортившийся вариант. Медиана не ждёт обратной связи и ограничивает влияние фильтра, у которого начали расходиться значения.
На ETTm1 RLS-Bank обошёл три из четырёх опубликованных методов при всех проверенных задержках. DynaTTA оказался лучше только при минимальной причинной задержке и тратил примерно в 2500 раз больше времени на обновление; линейный корректор в стиле ELF при этом опередил и DynaTTA.
На остальных наборах наибольшее статистически значимое улучшение опубликованного метода относительно его же замороженной модели составило 0,5%. На ETTh2 увеличение задержки сделало вредными все адаптеры, результат которых отличался от замороженной модели.
Утечка завышала видимый выигрыш простых адаптеров до 110%. Ещё сильнее влиял рецепт обучения исходной модели: он менял ошибку замороженного прогноза до 25 раз. Выбор и обучение основы поэтому дали больший эффект, чем любой проверенный способ адаптации.
Что менять в планах продукта
Отказываться от адаптации целиком оснований нет: ETTm1 показывает, что она помогает при подходящем характере сдвига данных. Но испытательный стенд должен воспроизводить момент, когда фактическое значение действительно становится доступно продукту. К горизонту прогноза следует прибавлять задержки измерения, проверки и загрузки в хранилище.
Перед градиентным адаптером стоит проверить замороженную модель, перенос последнего значения, сезонный прогноз и простой линейный корректор. RLS-Bank на узких потоках обновлялся за 56 микросекунд на одном ядре процессора и не требовал подбирать параметры после развёртывания. Такой контроль показывает, окупает ли сложный адаптер вычисления и риск расхождения.
Сравнивать нужно на одном потоке прогнозов и с одной контрольной точкой. Иначе изменение рецепта обучения основы легко маскируется под эффект адаптации. Стоимость также лучше считать на шаг потока, а не на одно обновление: методы запускают обновления с разной частотой.
Практический порядок меняется так: сначала причинный протокол и сильная исходная модель, затем дешёвый корректор, после него — TTA с градиентными обновлениями. Если преимущество остаётся только при немедленной выдаче полного целевого окна, в рабочем конвейере оно не воспроизведётся.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



