Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Из Mamba-моделей прогноза поверхности суши научились удалять влияние временных сбоев, которое сохраняется после завершения самого события. SSU-LSF потребовал в 8,4 раза меньше GPU-времени, чем полное переобучение; работа не рецензирована, а числа в ней получил сам автор. Для команд это открывает промежуточный вариант между сохранением систематической ошибки и повторным обучением всей модели.
Почему временный сбой остаётся внутри модели
Модели пространства состояний семейства Mamba последовательно обновляют скрытое состояние и переносят информацию вдоль временного ряда. В прогнозах поверхности суши так связываются спутниковые наблюдения, погода, индекс NDVI, который отражает состояние растительности, и температура поверхности суши LST.
Эта память становится проблемой, если в обучающие данные попадает временное изменение, которого нет среди входных признаков. Незарегистрированное орошение, новый режим работы плотины или перекалибровка датчика выглядят для модели как обычная закономерность. Параметры перехода между состояниями усваивают её и продолжают смещать прогноз после того, как физическая причина исчезла.
Обычный откат градиента заставляет модель хуже воспроизводить нежелательные примеры, но может задеть полезные зависимости. Методы, которые защищают важные веса от изменений, решают обратную задачу: они мешают стереть именно тот след, который требуется удалить. Полное переобучение на очищенном архиве работает как контрольный вариант, однако заново оплачивает весь цикл вычислений.
Как SSU-LSF находит и стирает след события
SSU-LSF начинает с известного временного интервала, в котором произошло искажающее событие. Метод оценивает, насколько каждый шаг ряда повлиял на матрицы перехода состояния. Для этого он приближённо учитывает кривизну функции ошибки с помощью EKFac и отдельно вычисляет градиент матричной экспоненты, через которую Mamba задаёт переходы.
Затем метод расширяет исходный интервал до фактического следа события. Граница зависит не только от высокой оценки влияния, но и от спектрального радиуса матрицы перехода. Эта величина показывает, как долго изменение скрытого состояния сохраняется в последующих шагах: чем медленнее оно затухает, тем дальше метод ищет остаточное смещение.
На найденном участке SSU-LSF повышает ошибку модели, чтобы ослабить выученную связь. Одновременно он сохраняет низкую ошибку на чистых данных и ограничивает изменение распределения прогнозов через KL-расхождение. Если обновление выходит за допустимую область, алгоритм уменьшает его шаг.
Ещё одно ограничение связывает параметры соседних пространственных участков. Без него модель может стереть среднее смещение, но создать резкие границы между соседними полями или ячейками сетки. В экспериментах именно пространственная регуляризация отвечала за связность результата, а локализация временного следа сильнее всего влияла на полноту разучивания.
Когда метод меняет планы разработки
Проверка охватила CropHarvest, NDVI-LST Fusion и ERA5 Patchified, а сравнение включало полное переобучение и методы приближённого разучивания. SSU-LSF удалил от 77,3 до 85,9% измеренного влияния события и сходился за 3–5 эпох. На ERA5 один запрос потребовал 5,6 GPU-часа против 47,3 GPU-часа для полного переобучения.
При этом метод почти не уступил ближайшим альтернативам по обычной ошибке прогноза, но лучше сохранял пространственную структуру. Проверка принадлежности обучающих примеров также приблизилась к уровню случайного угадывания: это служит дополнительным признаком того, что представление нежелательного участка действительно ослабло, а не только перестало проявляться в одной итоговой метрике.
Основные эксперименты использовали искусственно внесённые искажения и заранее известные интервалы событий. Отдельная проверка охватила документированную перекалибровку спутникового датчика, а перенос с Mamba на S4 показан лишь на одном наборе данных. Теоретическая граница ошибки оказалась примерно в 200 раз свободнее наблюдаемого результата, поэтому она объясняет направление эффекта, но не позволяет заранее рассчитать качество исправления.
Работа меняет планы команд, которые уже используют Mamba для геопространственных временных рядов и регулярно исправляют архивы. В таком контуре стоит сохранять точные интервалы изменений, чистую контрольную выборку и проверки пространственной связности: без них SSU-LSF нельзя применить в описанном виде.
Как универсальная замена переобучению метод пока не выглядит. Он требует указать момент сбоя, заново оценивать влияние для каждого запроса и отдельно проверять, не стёрла ли модель настоящий сигнал. Но при повторяющихся локальных исправлениях появляется практический третий путь: обновлять затронутую часть памяти модели, не запускать полный цикл обучения и контролировать ущерб на чистых данных.
Источники
Иллюстрация: рисунок из статьи «State-Space Unlearning for Non-Stationary Bias in Land Surface Forecasting», Anidipta Pal, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



