Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Предобученную генеративную модель научились приспосабливать к восстановлению изображений и речи, не меняя её веса и не собирая полный набор пар «чистый сигнал — испорченное наблюдение». В работе University of Hamburg метод LSA справился с задачами ImageNet-256 на 128 парах, около 0,01% обучающего набора, хотя препринт не рецензирован и числа получены самими авторами. Это позволяет отделить дорогую модель чистых данных от небольших модулей под конкретные камеры, каналы связи и другие источники искажений.
LSA учит поправку к замороженной модели
Обратная задача начинается с испорченного наблюдения: размытого изображения, записи с шумом или сигнала с потерянными частотами. Требуется восстановить исходник, хотя одному наблюдению могут соответствовать разные правдоподобные варианты.
Генеративная модель помогает выбрать среди них: она хранит априорное распределение чистых данных, то есть знает, как обычно выглядят изображения или звучит речь. Информация о конкретном искажении задаёт правдоподобие наблюдения при выбранном исходнике. Вместе эти части определяют распределение возможных восстановлений.
Обычные методы используют один из двух путей. Если оператор искажения известен, его применяют во время каждого шага генерации и вычисляют направление коррекции. Если оператор неизвестен, условную модель обучают на парах чистых и испорченных данных, иногда меняя часть весов исходной сети через LoRA или добавляя ControlNet.
LSA оставляет безусловную генеративную модель неизменной и обучает отдельную сеть. Она получает текущее зашумлённое состояние, наблюдение и положение на генеративной траектории, а затем предсказывает поправку к выходу исходной модели. Эта поправка приближает градиент логарифма правдоподобия: направление, в котором промежуточный результат лучше согласуется с наблюдением.
Выходы двух сетей складываются. Исходная модель отвечает за свойства чистых данных, а LSA — за конкретное искажение. Сети не делят параметры и промежуточные признаки, поэтому основной генератор не приходится переобучать для каждой новой задачи.
Метод работает как с моделями, которые предсказывают направление к более вероятным данным, так и с моделями переноса от шума к данным. Представление LSA можно выбрать независимо от внутреннего представления исходной сети. При генерации доступны детерминированная траектория и вариант со случайностью.
Известный оператор заменяет реальные пары синтетическими
Если процесс искажения неизвестен, LSA обучают на небольшом фиксированном наборе реальных пар. Если он известен, чистые примеры генерирует замороженная модель, после чего к ним применяют оператор искажения. Реальные парные данные в таком режиме не нужны, но появляется отдельный этап обучения условной сети.
На ImageNet-256 LSA сравнивали с ControlNet, LoRA и DEFT на сверхразрешении, восстановлении пропусков, нескольких видах устранения размытия и расширении динамического диапазона. Метод показал меньший FID — метрику различия между распределениями восстановленных и исходных изображений — и меньший LPIPS, который оценивает визуальное различие по признакам нейросети.
На восьмикратном увеличении ImageNet-512 модель с 100 реальными парами получила лучший FID, чем сильнейший сравниваемый вариант DMAP+CSE с 1000 парами. Для речи проверяли подавление шума, восстановление высоких частот и фазы; адаптеры обучали на 1 или 10 минутах записей. При известном искажении синтетические пары дали PESQ 4,55 — оценку качества речи, близкую к верхней границе этой метрики.
Проверки охватывают две модальности и несколько типов обратных задач, но все они используют заранее обученную модель соответствующего вида чистых данных. Сравнение при известных операторах также учитывает важное различие: конкуренты применяют оператор во время генерации, а LSA заранее переносит его свойства в отдельную сеть.
Когда разделение меняет архитектурный план
LSA имеет смысл закладывать в архитектуру, если один генеративный фундамент должен обслуживать несколько способов наблюдения. Например, модель чистой речи можно оставить общей, а для разных микрофонов, каналов передачи или полос пропускания обучать отдельные условные модули. Дорогая часть при этом не меняется и не размножается.
При известном операторе команда получает выбор между вычислениями во время каждого восстановления и предварительным обучением адаптера на синтетических парах. Второй вариант полезен для повторяющейся производственной нагрузки: работа переносится из каждого запуска в отдельный этап подготовки модели. Для единичной задачи этот дополнительный этап может не дать практического выигрыша.
Авторы также заменяли априорную модель после обучения LSA: в изображениях подставляли другие контрольные точки, а в речи — сеть другой архитектуры. Полной взаимозаменяемости здесь нет. Новая модель должна использовать ту же генеративную траекторию, а LSA частично компенсирует ошибки той сети, с которой обучалась, поэтому точное сохранение результата не гарантируется.
Работа меняет план не за счёт нового универсального восстановителя, а за счёт границы между компонентами. Если уже есть подходящая безусловная модель и мало парных данных, её можно зафиксировать и добавлять небольшие модули под наблюдения. Если такого основания нет, LSA не устраняет необходимость сначала обучить модель чистых данных.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



