Журнал · Rit.work

DART переносит LoRA на короткую генерацию видео без повторного обучения

DART калибрует старые LoRA под сокращённый процесс видеодиффузии, сохраняя качество и часть функции адаптера без исходных обучающих роликов.

Rit.work
Студия разработки
18 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Существующие LoRA для длинного процесса видеодиффузии удалось перенести на сокращённый процесс без повторного обучения и исходных обучающих роликов. На Wan2.2 метод DART-F поднял сводную оценку качества с 0,9029 до 0,9227; препринт Shihong Li и коллег не рецензирован, и все числа в нём получили сами авторы. Такой перенос позволяет ускорить генерацию, не создавая отдельный адаптер для каждой сокращённой версии модели.

Совместимые веса ещё не сохраняют функцию адаптера

LoRA хранит изменение модели в виде небольшой низкоранговой добавки к её весам. Эту добавку можно технически подключить к дистиллированной версии модели, но результат зависит не только от совместимости весов: важны скрытое состояние ролика, текущий шаг очистки от шума и входные условия.

Дистилляция меняет все эти условия. В основном опыте исходная Wan2.2-I2V-A14B строила видео за 40 шагов, а целевая версия — за 4. Один и тот же адаптер на укороченной траектории мог ослабнуть, изменить направление эффекта или испортить структуру видео.

Близкая геометрия весов не предсказывала поведение LoRA. У адаптеров почти совпадали ошибки переноса между координатами моделей, но заметно расходились качество роликов и сохранение заданного движения, стиля или объекта. Поэтому авторы измеряли не только сами параметры, но и то, как добавление LoRA меняет выход блока очистки от шума на целевых шагах.

Чтобы отделить функцию адаптера от качества базовой модели, работу оценивали через опорные режимы: исходная и целевая модели запускались с LoRA и без неё. Если целевая модель сама по себе строит хороший ролик, это ещё не означает, что перенесённый адаптер сохранил нужный эффект.

Как DART подстраивает LoRA под новый процесс

DART сначала строит промежуточное представление между исходными и дистиллированными весами. Затем метод выравнивает группы близких сингулярных направлений и переносит в новые координаты низкоранговую добавку LoRA. Этот этап сохраняет ранг и величину обновления, но сам по себе не гарантирует прежний результат генерации.

После переноса DART раскладывает добавку на каналы ранга один. Для каждого канала метод выполняет парные прямые проходы: сравнивает выход модели с небольшой положительной и отрицательной добавкой на состояниях и шагах целевого процесса. Обратное распространение ошибки не требуется.

По этим откликам метод подбирает постоянные коэффициенты каналов. Он согласует направление и величину эффекта с исходной моделью, а также распределяет его по шагам генерации. Если выбранные пробы не позволяют различить некоторые сочетания каналов, регуляризация оставляет их коэффициенты близкими к исходным и не вносит неподтверждённые изменения.

Калибровка привязана к конкретной целевой модели и её расписанию шагов. Зато для неё не нужны ролики, на которых обучали LoRA: достаточно весов исходной и целевой моделей, самого адаптера и прямых вычислений на целевых состояниях.

Переезд на дистиллированную модель потребует отдельной проверки LoRA

Полная версия DART-F изменила среднее сохранение функции адаптера с −0,4644 при прямом подключении до +0,1349. Отрицательное значение означает, что LoRA в среднем ухудшала выбранный функциональный показатель относительно целевой модели без адаптера. Положительный итог показывает частичное возвращение нужного эффекта, но не полное воспроизведение поведения исходной модели.

Большую часть прироста качества дала калибровка отклика. Перенос координат дополнил её и помог получить положительный средний функциональный результат. Простое уменьшение общей силы LoRA не решило обе задачи одновременно: оно могло ослабить вредный эффект, но вместе с ним ослабляло и полезный.

Основную проверку провели на шести адаптерах и 528 роликах для каждого сравниваемого метода. Адаптеры управляли разными эффектами, включая стиль и движение камеры; тот же общий тренд получили на двух других целевых конфигурациях. При этом у половины адаптеров основной показатель функции не стал положительным, а общий прирост качества заметно зависел от конкретного LoRA.

Работа меняет план миграции, если продукт уже накопил собственную библиотеку LoRA и собирается перейти на короткую генерацию. Прямое подключение стоит считать только исходной точкой: команде понадобятся режимы без адаптера, проверка нужного эффекта относительно исходной модели и отдельная оценка повреждений видео.

DART снимает требование к исходному обучающему набору, но не делает перенос бесплатным. После общего подготовительного расчёта преобразование одного адаптера занимало около 131 минуты. Поэтому метод лучше подходит для заранее отобранной библиотеки LoRA, чем для преобразования каждого случайного адаптера при запросе.

Проверка остаётся узкой: она охватывает одну основную пару моделей, небольшой набор адаптеров и фиксированный набор проб. Повторные запуски с другими начальными случайными состояниями в работе не установили. Для производственного решения DART стоит рассматривать как способ сократить повторное обучение, а не как доказательство автоматической совместимости всех LoRA с любой дистиллированной моделью.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу