Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
SGLang-Diffusion получил поддержку Qwen-Image-2.1 в день выхода модели. Сервер запускает генерацию, редактирование по нескольким изображениям и вывод прозрачных файлов RGBA; локально модель можно развернуть на потребительской видеокарте, но почти вся её память окажется занята.
По замерам команды SGLang, на RTX 4090 с 24 ГБ памяти модель работает в исходной точности только с выгрузкой части данных на процессор. Во время запроса она занимает до 22,7 ГиБ видеопамяти, генерирует изображение за 18,7 секунды, а редактирует за 21,7 секунды.
На RTX PRO 6000 генерация занимает 8 секунд — более чем вдвое меньше. Для развёртывания это задаёт понятную границу: RTX 4090 подходит, если допустима задержка около двадцати секунд и выгрузка на процессор, а результат быстрее десяти секунд в опубликованном замере потребовал профессиональной видеокарты.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



