Журнал · Rit.work

SAGG фильтрует испорченные примеры до обновления мультимодальной модели

SAGG отбрасывает градиент всего примера, если хотя бы одна модальность выглядит испорченной, и обходит пакетную балансировку на видео- и аудиодатасетах.

Rit.work
Студия разработки
18 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Градиенты мультимодальной модели можно очистить от разнородных повреждений, если решать судьбу каждого примера отдельно и целиком исключать ненадёжные примеры. Работа Tsinghua University и Sichuan University показывает преимущество такого подхода над общей балансировкой пакета, хотя препринт не рецензирован и все числа получили сами авторы. Для команд это меняет точку вмешательства: корректировать стоит не модальность во всём пакете, а отдельные обучающие примеры.

Общий коэффициент смешивает чистые и испорченные градиенты

Многие способы балансировать мультимодальное обучение вычисляют один коэффициент для каждой модальности и применяют его ко всему пакету. Такой подход предполагает, что качество данных внутри пакета меняется одинаково: например, звук испорчен у всех примеров или не испорчен ни у одного.

В реальных наборах повреждения могут чередоваться. У одного видео чистое изображение и шумный звук, у следующего — чистый звук и повреждённое изображение. Общий коэффициент ослабляет как ошибочные, так и полезные градиенты, потому что не различает эти примеры.

Проблему усиливает устройство модели. Отдельные кодировщики объединяют признаки перед общим классификатором, поэтому повреждение одной модальности влияет на функцию потерь и градиенты всех кодировщиков. Нельзя безопасно сохранить градиент изображения, просто отбросив градиент звука: оба уже зависят от общего предсказания.

В выбранном авторами классе линейных оценок единый коэффициент для пакета не может устранить это смещение при произвольных повреждениях. Единственная несмещённая схема принимает пример целиком, когда все его модальности чисты, либо целиком исключает его. Это теоретический результат для заданной модели повреждений, а не универсальное доказательство для любой мультимодальной архитектуры.

Как SAGG решает, оставлять ли пример

SAGG реализует бинарный фильтр перед обновлением параметров. Кодировщик строит признаки каждой модальности, после чего метод сравнивает их нормы со статистикой, которую поддерживает через экспоненциальное скользящее среднее. Если норма хотя бы одной модальности выходит за допустимый диапазон, градиент всего примера не участвует в обновлении.

Такой тест не требует отдельного реконструктора или классификатора качества. Его можно заменить другим детектором, не меняя сам принцип SAGG: решение остаётся индивидуальным для примера и общим для всех его модальностей.

Отбрасывание данных уменьшает эффективный размер пакета и повышает разброс градиентов. Поэтому SAGG пропускает обновление, если после фильтра осталось слишком мало примеров. Порог связывает компромисс между двумя ошибками: низкий порог допускает нестабильные обновления, высокий заставляет слишком часто их пропускать.

Теоретическая гарантия относится к идеальному фильтру, который точно знает, какие примеры чисты. Для него метод сходится к стационарной точке чистой функции потерь со скоростью O(1/T) и без постоянной ошибки, зависящей от доли повреждений. Практический фильтр по нормам признаков может принять испорченный пример и вернуть смещение; влияние таких ошибок в работе формально не разобрано.

Меняет ли работа планы мультимодальных команд

Метод проверяли на Kinetics-Sounds и UCF-101 с независимыми кодировщиками ResNet-18 и общим линейным классификатором. Испытания охватывали гауссов шум, отсутствующую модальность и естественный дисбаланс вклада; SAGG сравнили с десятью методами, включая OGM, GMML, MMPareto и Reconboost.

Без искусственных повреждений SAGG опередил GMML на 1,73 процентного пункта по точности на Kinetics-Sounds. Когда у части примеров отсутствовало изображение, разрыв вырос до 4,35 пункта. При усилении шума преимущество также росло, что согласуется с основной гипотезой: общий коэффициент хуже работает, когда повреждения внутри пакета различаются сильнее.

Авторы отдельно оценили устойчивость через запас до смены предсказанного класса и чувствительность кодировщиков к входным данным. Средний сертифицированный радиус SAGG оказался на 47% выше, чем у GMML. Это расчёт для архитектуры с независимыми кодировщиками, а не гарантия устойчивости любой модели с перекрёстным вниманием или ранним объединением модальностей.

Работа даёт основание пересмотреть пакетную балансировку, если продукт обучается на аудио, видео или нескольких сенсорах, а качество каналов меняется от записи к записи. Практический план — отделить механизм фильтрации от правила обновления и проверить, умеет ли выбранный признак качества отличать повреждения конкретного набора данных. Без такого теста теоретическое преимущество SAGG не переносится на рабочую систему: ошибочный фильтр снова пропускает смещённые градиенты.

Источники

Иллюстрация: рисунок из статьи «SAGG: Sample-Adaptive Gradient Gating for Robust Multimodal Learning under Heterogeneous Corruption», Wentao Zhang, Yifan Zhu, Yutong Zhang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу