Журнал · Rit.work

PASEO ускоряет восстановление изображений без обратного прохода через диффузионную модель

PASEO заменяет дорогой обратный проход через диффузионную модель локальным решением в латентном пространстве и в тестах ускоряет восстановление изображений до 19 раз.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Новый способ ускоряет восстановление размытых, неполных и уменьшенных изображений с помощью латентной диффузионной модели. Хотя препринт Abduragim Shtanchaev и коллег не рецензирован и числа в нём получили сами авторы, результат заметен: PASEO работал до 19 раз быстрее проверенных альтернатив и занимал до 34% меньше памяти. Для продукта это открывает вариант оставить генеративную модель неизменной, а учить небольшой модуль под конкретное искажение.

Как наблюдение связывают с латентным пространством

При восстановлении известен испорченный снимок, а система должна подобрать правдоподобный оригинал, который мог его породить. Диффузионная модель знает, как выглядят естественные изображения, но работает со сжатым латентным представлением. Размытие, маска или уменьшение разрешения обычно заданы в пикселях, поэтому на каждом шаге приходится согласовывать два пространства.

Часть существующих методов декодирует промежуточный результат, применяет искажение и проводит обратный проход через крупную диффузионную модель. Это связывает восстановление с наблюдением, но требует хранить промежуточные значения для вычисления производных. SILO сократил работу с кодировщиком и декодировщиком, обучив отдельный оператор искажения в латентном пространстве, однако сохранил обратный проход через оператор и модель шумоподавления.

PASEO тоже заранее обучает латентный оператор для каждого вида искажения и пространства модели. Это сеть примерно на миллион параметров, которая получает чистое латентное представление и предсказывает, как будет выглядеть закодированная испорченная версия. Диффузионная модель и автокодировщик при таком обучении остаются неизменными.

Во время восстановления модель шумоподавления сначала задаёт вероятное чистое представление и разброс вокруг него. После этого PASEO больше не вычисляет через неё производные. Метод добавляет случайный шум к текущей оценке и наблюдению, локально заменяет обученный оператор линейным и решает получившуюся систему методом сопряжённых градиентов.

Для линейного оператора и точно решённой системы такой шаг даёт точную выборку из приближённого распределения возможных оригиналов. Для обученной нелинейной сети результат остаётся приближённым: оператор линеаризуют только рядом с текущей точкой, а внутренний решатель делает ограниченное число итераций.

Главная экономия возникает потому, что производные проходят только через небольшую сеть оператора. Кодировщик обрабатывает входное изображение один раз, а декодировщик один раз строит итог. PASEO также не создаёт ковариационную матрицу: для SD3.5-medium она содержала бы около 4,3 млрд элементов.

Где ускорение сохранило качество

Метод проверяли на пяти задачах: увеличении разрешения, включая два масштаба, гауссовом размытии, заполнении удалённой области и артефактах JPEG. Эксперименты охватили FFHQ и COCO, а в качестве генеративной основы использовали RV-v5.1 и SD3.5-medium. Среди сравнений были SILO, DING, ReSample, DAPS и другие решатели обратных задач.

По LPIPS, метрике визуального сходства восстановленного изображения с оригиналом, PASEO занимал первое или второе место почти во всех задачах. Меньшее значение LPIPS означает, что признаки двух изображений ближе, даже если отдельные пиксели не совпадают.

На SD3.5-medium максимальное ускорение достигло 19 раз, а пиковое потребление памяти сократилось до 34%. При этом PASEO делал столько же или меньше обращений к модели шумоподавления. Это предельные результаты среди разных задач и способов сравнения, а не постоянный коэффициент для любого изображения.

Проверка охватывает восстановление фотографий при заранее заданных искажениях. Оператор обучали отдельно под каждое искажение и латентное пространство, поэтому замеры не показывают универсальный модуль, который можно без подготовки подключить к новому формату повреждения.

Когда PASEO меняет план разработки

Работа влияет на архитектуру систем, где обратный проход через диффузионную модель уже ограничивает задержку или доступный объём GPU. Вместо дообучения основы можно зафиксировать генеративную модель и вынести связь с наблюдением в небольшой оператор. Такой подход упрощает память во время выполнения и позволяет независимо менять решатель.

Цена этой схемы переносится в подготовку операторов. Для нового размытия, кодека, датчика или латентной модели потребуется собрать пары чистых и испорченных данных, обучить оператор и отдельно проверить, насколько верно он передаёт физику искажения. Замена автокодировщика также меняет латентное пространство и требует нового оператора.

Для одного простого сценария, например заполнения области по известной маске, переход может не окупиться: специализированный решатель способен использовать структуру маски напрямую. PASEO интереснее платформам, которые поддерживают несколько видов восстановления и сейчас платят за вычисление производных через крупную модель на каждом шаге.

Менять производственный контур только ради максимального ускорения рано. Практичный следующий шаг — прототип на собственном искажении с замером задержки, памяти и качества, поскольку выигрыш зависит от обученного оператора и настроек внутреннего линейного решателя.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу