Журнал · Rit.work

Почему маршрутизации MoE недостаточно для изоляции LoRA-адаптеров

SpawnLoRA разделяет конфликтующие обновления внутри экспертов и в экспериментах авторов лучше сохраняет качество кода, чем общий адаптер с увеличенным рангом.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Islamic University of Technology, York University и Dialpad проверили отрицательный перенос при многодоменной настройке MoE-моделей с LoRA; работа опубликована как препринт, который не проходил рецензирования. В наиболее конфликтной смеси на OLMoE-1B-7B предложенный метод SpawnLoRA снизил перплексию кода на 26,9% относительно обычной LoRA. Результат важен командам, которые дообучают одну открытую модель для нескольких предметных областей и рассчитывают, что маршрутизатор сам разделит их влияние.

Что сделали

В архитектуре «смесь экспертов» (MoE) маршрутизатор направляет каждый токен в небольшую часть экспертных блоков. LoRA добавляет к замороженным весам компактные обучаемые матрицы низкого ранга. При совместном использовании этих подходов возникает естественное предположение: если токены разных областей попадают к разным экспертам, их обновления не должны мешать друг другу.

Авторы проверили это предположение, выбрав Python-код из HumanEval основной областью. К нему добавляли биомедицинские тексты PubMedQA как сильнее отличающуюся область и математические рассуждения GSM8K как более близкую. На каждую обучающую смесь приходилось 2 000 примеров и 3 000 шагов. Отрицательный перенос определяли как рост перплексии на отложенном коде относительно настройки только на коде: чем ниже перплексия, тем меньше неопределённость модели при предсказании следующего токена.

Чтобы найти источник ухудшения, авторы ввели две диагностики. Пересечение маршрутов по коэффициенту Жаккара показывает, насколько часто области используют одних экспертов. Косинусное сходство градиентов показывает, насколько совместимы направления обновления LoRA-адаптера: близкие направления помогают общей оптимизации, противоположные или почти перпендикулярные конкурируют за ограниченное пространство адаптера.

Предложенный метод SpawnLoRA не меняет исходный маршрутизатор. Если внутри эксперта сохраняется конфликт, метод добавляет отдельный LoRA-подадаптер. Вклад такого пути регулируется обучаемым затвором на основе ReLU, поэтому специализация зависит от входных данных и не требует метки предметной области при применении модели. Новый путь инициализируется по направлениям градиента, которые существующий адаптер передаёт хуже всего.

Что показали

На Phi-tiny-MoE-instruct среднее пересечение маршрутов кода и биомедицинских текстов составило 0,056. Это соответствует почти раздельному выбору экспертов, однако качество кода всё равно ухудшалось. Следовательно, наблюдаемое авторами вмешательство нельзя объяснить только ошибкой маршрутизатора.

Косинусное сходство градиентов областей составило −0,002, то есть направления обновления были почти перпендикулярны. Авторы интерпретируют это как конкуренцию внутри одного низкорангового пространства: маршрутизатор разделяет токены между экспертами, но не создаёт независимые направления обновления внутри используемых адаптеров.

Простое увеличение ранга в DR-LoRA не решило проблему и в наиболее конфликтных режимах уступило фиксированной LoRA. По интерпретации авторов, дополнительная общая ёмкость предоставляет областям больше совместных направлений, но не изолирует их. SpawnLoRA вместо этого создаёт отдельные пути только в экспертах, где обнаружен конфликт.

На дополнительной проверке с MBPP точность предсказания токенов кода выросла с 19,71% у LoRA до 33,18% у SpawnLoRA. Это поддерживает результат по перплексии, хотя не доказывает, что модели стали надёжно решать полноценные задачи программирования.

Ограничения

Работа проверяет только HumanEval в сочетании с PubMedQA или GSM8K. Она не показывает, сохраняется ли тот же механизм при большем числе одновременно подключённых областей, для многоязычных данных или для областей с менее выраженными различиями.

Эксперименты ограничены двумя семействами MoE-моделей масштаба до 7 млрд полных параметров, коротким режимом обучения и тремя случайными инициализациями. Основная метрика — перплексия; доля задач, решённых с первой попытки, на таком объёме обучения оставалась недостаточно информативной. Поэтому работа не подтверждает эффект на крупных производственных моделях, длительном дообучении и прикладных показателях готового продукта.

Сравнение методов также узкое: авторы сопоставили SpawnLoRA с обычной LoRA и DR-LoRA. Параметрически выровненная проверка проведена только для OLMoE с GSM8K и не повторена для Phi. Экспериментального сравнения с заранее разделёнными доменными адаптерами и другими вариантами структурной изоляции в работе нет.

Что это значит

Работа меняет план экспериментов, но пока не обосновывает замену архитектуры в действующей системе. Если одна MoE-модель последовательно дообучается на коде, документах, поддержке или других областях, статистики маршрутизатора недостаточно. Раздельный выбор экспертов ещё не означает, что LoRA-обновления совместимы внутри каждого эксперта.

В протокол проверки стоит добавить измерение градиентов по областям и контрольную оценку каждой ранее освоенной области после добавления новой. Если маршруты разделены, а качество всё равно падает, увеличение ранга LoRA не следует считать автоматическим решением: по замерам авторов оно способно сохранить или усилить конкуренцию.

SpawnLoRA задаёт практическое направление — создавать независимые адаптационные пути только там, где диагностика обнаруживает устойчивый конфликт. Однако перед внедрением команде потребуется проверить расходы памяти и вычислений, стабильность условия создания подадаптеров и влияние на целевые продуктовые метрики. Представленные результаты достаточны, чтобы не полагаться только на маршрутизацию, но недостаточны, чтобы считать SpawnLoRA готовым универсальным выбором.

Источники

Иллюстрация: рисунок из статьи «Routing Is Not Enough: Diagnosing Intra-Adapter Subspace Contention in MoE+LoRA Fine-Tuning», Mehreen Hossain Chowdhury, Nowshin Mahjabin, Ahmed Shafin Ruhan и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу