Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Уровень воды на всей речной сети научились восстанавливать по редким спутниковым замерам без обработки полного пространственно-временного графа. Ruben Cartuyvels и соавторы собрали набор AmazonWSE и снизили среднеквадратичную ошибку (RMSE) на 18–39% относительно Reach-Reg, хотя работа не рецензирована и все числа получили сами авторы. Для проектов с очень разреженными графами результат предлагает практичную альтернативу: сначала превратить наблюдения в последовательность, а не усложнять передачу сообщений между узлами.
Почему полный граф здесь мешает модели
AmazonWSE объединяет спутниковые измерения высоты водной поверхности и топологию Амазонки. Граф включает 19 172 участка рек, связанных по направлению течения, а временная ось покрывает ежедневные наблюдения за десятилетие.
В любой день измерен менее 1% участков. Если развернуть такие данные в обычную таблицу «участок × день», почти все ячейки окажутся пустыми. Графовым нейросетям при этом приходится либо передавать сообщения через узлы без наблюдений, либо добавлять множество служебных элементов, которые обозначают пропуски.
Задачу усложняют сами источники. Несколько спутников могут измерить один участок в один день и получить разные значения из-за особенностей приборов. Сеть рек тоже отличается от дорожных и городских графов: вода движется по направленному графу без циклов, а притоки сходятся в более крупные русла.
Модель проверяли только на ежедневной высоте воды в бассейне Амазонки. Наземные данные с 375 гидрологических постов не использовали ни для обучения, ни как вход модели: их оставили для оценки. Эксперименты охватили период работы SWOT и восстановление более ранних лет по измерениям HydroWeb и ICESat-2, поэтому работа проверяет как заполнение текущих пропусков, так и перенос назад во времени.
Как разреженный граф становится последовательностью
Для каждого обучающего примера выбирают опорный участок, временной интервал и связную окрестность выше и ниже по течению. В последовательность попадают только реальные спутниковые измерения. Пропущенные сочетания участка и дня не создают элементов, поэтому более разреженные данные дают более короткий вход, а не более крупную пустую сетку.
Каждое измерение превращается в токен — компактную запись значения и его контекста. К нему добавляют дату, месяц, источник, координаты, положение относительно нижнего участка и путь по локальному дереву притоков. Отдельная запись передаёт средний уровень воды относительно нижней точки выбранного фрагмента.
Токены сначала сортируют по дню, а внутри дня — по направлению течения. Затем их обрабатывает селективная модель пространства состояний на основе Mamba. Такая модель последовательно обновляет сжатое внутреннее состояние и выбирает, какую информацию сохранить; двунаправленная версия проходит последовательность в обе стороны, поэтому учитывает как предыдущие и последующие даты, так и связи вверх и вниз по реке.
При обучении часть известных измерений скрывают, а модель восстанавливает их по оставшемуся контексту. При применении вместо скрытого значения добавляют запрос с датой, участком и метаданными. Чтобы получить ряд для конкретной точки, не требуется одновременно запрашивать значения для всего графа.
Топология при таком подходе не исчезает. Она определяет, какие соседние участки войдут в пример, задаёт порядок токенов и кодируется в метаданных. Разница с графовой нейросетью в том, что модель не передаёт сообщение через каждое ребро на каждом временном шаге.
Когда подход меняет архитектурный план
Полная конфигурация получила RMSE 0,56. Случайный порядок токенов ухудшил результат до 0,64, однонаправленная обработка — до 0,72, а работа с изолированным временным рядом без соседних участков — до 2,58. Значит, выигрыш даёт не только архитектура Mamba: важны связная выборка контекста, порядок по времени и течению, а также просмотр последовательности с двух сторон.
Для команд, которые строят восстановление пропусков на сетях датчиков, трубопроводах, логистических маршрутах или других крупных графах, работа меняет порядок прототипирования. Если наблюдения редки, стоит сначала проверить представление, где вход содержит только события, а локальный граф управляет выборкой и позиционными признаками. Это может сократить вычисления и избавить модель от обработки служебных пропусков.
Работа не показывает, что последовательные модели всегда лучше графовых. Её вывод относится к направленной речной сети с крайне редкими измерениями, а сравнение проведено на одном бассейне и одной физической величине. Но для похожего режима она даёт конкретный базовый проект: связные подграфы, разреженные токены, явные признаки топологии и двунаправленная обработка до попытки обучать полный граф.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



