Журнал · Rit.work

PaTh отделяет рассуждение от отрисовки в диффузионной модели

Архитектура PaTh проверяет решение в скрытом состоянии, прежде чем диффузионная модель перенесёт его в изображение.

Rit.work
Студия разработки
8 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Диффузионную модель научили решать визуальные задачи с жёсткими правилами без символьной разметки. На самой сложной версии MNIST Sudoku архитектура PaTh собрала правильную сетку в 71,2% случаев против прежних 4,1%, хотя работа не рецензирована и числа получили сами авторы. Для генераторов с проверяемыми ограничениями это предлагает альтернативу масштабированию основной модели: вынести рассуждение в отдельный модуль.

Команда Warsaw University of Technology, IDEAS Research Institute и University of Amsterdam разделила систему на Painter и Thinker. Painter остаётся диффузионной моделью с зафиксированными весами, а Thinker на каждом шаге удаления шума рекурсивно уточняет скрытое состояние. Через адаптеры ControlNet он направляет Painter только после серии внутренних итераций, поэтому может отбросить неудачный вариант до того, как тот попадёт в изображение.

PaTh обучали с обычной функцией потерь на восстановление изображения. Ей не давали правильные решения в символьном виде, отдельный решатель или модуль проверки. В конфигурации для Sudoku у PaTh было 10 млн параметров против 82 млн у стандартной диффузионной модели: дополнительные вычисления ушли на поиск решения, а не на более крупный модуль отрисовки. В опытах с намеренно испорченными промежуточными результатами Thinker также исправлял ошибки, с которыми базовая модель уже не справлялась.

Метод проверяли на MNIST Sudoku, лабиринтах и задаче Queens из AMAZE, а также на сценах CLEVR с заданными пространственными отношениями. Сравнивали со стандартными диффузионными моделями, методами повторной генерации и моделями редактирования изображений; преимущество росло вместе со сложностью задачи. Все эти наборы дают точные правила проверки, поэтому результат относится прежде всего к генерации схем, сцен и других изображений, где корректность можно формально задать.

Для архитектуры продукта главный вывод — не заставлять один генератор одновременно искать решение и рисовать результат. Отдельное скрытое состояние позволяет тратить вычислительный бюджет на перебор и пересмотр вариантов, сохраняя основной генератор без изменений. Такой модуль можно обучать по готовым правильным изображениям, если они уже отражают нужные ограничения.

Источники

Иллюстрация: рисунок из статьи «Think Before You Paint: Recursive Latent Reasoning for Diffusion Models», Pawe{\l} Skier\'s, Ma{\l}gorzata Grzanka, Wojciech Masarczyk и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу