Журнал · Rit.work

READ объединяет LoRA-навыки без роутинга

READ приводит LoRA-адаптеры к общей системе координат и разрешает новым навыкам читать старые, не меняя их внутренние связи.

Rit.work
Студия разработки
28 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Новые LoRA-адаптеры научились добавлять в одну модель так, чтобы они использовали старые навыки, но не переписывали их внутренние связи. В препринте университетов Шанхая, Сианя, Гуанчжоу и Цзинаня, который не прошёл рецензирование и содержит замеры самих авторов, метод READ в среднем обошёл сильнейшую альтернативу на 7,3 пункта. Результат предлагает третий вариант между повторным слиянием всех адаптеров и роутером, который выбирает нужный адаптер при каждом запросе.

Почему одинаковые LoRA-обновления по-разному ведут себя при слиянии

LoRA хранит дообучение модели как произведение двух небольших матриц. Пока адаптер работает отдельно, важен только итог этого умножения: внутреннее представление можно изменить множеством способов, не меняя само обновление весов.

При объединении адаптеров эта свобода перестаёт быть безобидной. Связь между двумя навыками работает не с готовыми обновлениями, а с внутренними направлениями их матриц. Эти направления зависят от случайной инициализации, порядка данных и хода обучения, поэтому два функционально одинаковых адаптера могут потребовать разных связей.

READ сначала переписывает каждый адаптер в каноническом виде. Для этого метод раскладывает матрицы так, чтобы обе части несли одинаковый масштаб, но их произведение оставалось прежним. Сам навык не меняется, зато взаимодействия между навыками больше не зависят от случайного способа записи.

Эксперимент с повторным разложением одних и тех же адаптеров подтвердил проблему: без канонизации итоговые оценки заметно менялись, хотя исходные обновления весов оставались идентичными. После приведения к общей системе координат разброс сократился. Это не прибавка качества сама по себе, а защита от нестабильности при сборке банка навыков.

Новый навык читает старые, но не пишет в них

Второе решение касается направления связи. Новый адаптер может либо записывать свои направления в выходные пространства старых навыков, либо читать их входные направления и использовать внутри собственного выхода. Первый вариант меняет вычисления уже собранного банка, второй оставляет его параметры и установленные связи замороженными.

READ разрешает только чтение. При добавлении навыка метод обучает новую строку матрицы связей и её диагональный блок. Матрицы старых адаптеров, прежние связи, базовая модель и общая языковая голова не обновляются.

Это не означает, что ответы на старых задачах математически гарантированно останутся прежними: новый выход всё ещё становится частью общей модели. Однако новый навык не может напрямую переписать выходные пространства старых адаптеров, а значит, один из главных источников интерференции исключён конструкцией метода.

Во время добавления READ делает проход по объединению старых и новых обучающих данных. После обучения все адаптеры и связи перемножаются заранее, а полученное обновление добавляется к базовым весам. На сервере остаётся обычная модель без роутера, отдельных голов и выбора адаптера по типу запроса. Инструкция в исходном запросе задаёт задачу и формат ответа.

READ меняет план для растущих банков адаптеров

Метод проверяли на Llama-3.2-3B и Qwen3-4B, наборах GLUE, SuperGLUE, Domain и BBH. В банк последовательно добавляли до шести независимо обученных адаптеров для классификации, где модель выводила метку как текст. READ сравнивали с методами, которые используют те же исходные адаптеры и тоже позволяют получить единый набор весов.

В конечном сравнении READ выиграл 24 из 32 последовательностей добавления. Все проигрыши пришлись на BBH: там старые задачи сохранялись, но одного прохода по данным не всегда хватало, чтобы новый навык приблизился к отдельно дообученному адаптеру.

Промежуточные шаги важнее финальной оценки для системы, куда навыки приходят постепенно. READ прошёл заданный авторами критерий надёжности в 72 из 92 подходящих переходов: новый навык должен был закрыть существенную часть разрыва с отдельным дообучением, а качество старых задач — остаться около прежнего уровня. На GLUE, SuperGLUE и Domain метод работал устойчивее, чем на BBH.

Для команды с набором независимо обученных LoRA-адаптеров работа оправдывает прототип READ, если цель — выпускать один контрольный файл модели и не держать роутер на пути запроса. Особенно полезна схема, когда навыки добавляют последовательно и повторное глобальное слияние каждый раз сдвигает уже проверенное поведение.

Архитектурный компромисс остаётся. Добавление требует доступа к данным старых задач, поэтому READ не заменяет обучение без повторного показа прошлых примеров. Проверка также охватывает классификацию и небольшие банки; выводы не переносятся автоматически на открытую генерацию или десятки адаптеров. Если продукт обязан сохранять каждый исходный адаптер как полностью изолированный режим, роутинг остаётся более прямым решением.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу