Журнал · Rit.work

MODL добавляет язык доменной мультимодальной модели без парных данных

MODL разделяет языковой и доменный LoRA-адаптеры и учит модель отвечать о спутниковых снимках на новом языке без мультимодальных примеров на нём.

Rit.work
Студия разработки
23 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Доменную мультимодальную модель научили отвечать на новом языке без примеров, где изображения из домена были бы связаны с текстом на этом языке. В нерецензированном препринте, где числа получили сами авторы, MODL давал правильный ответ на нужном языке в 56–71% случаев. Такой подход позволяет использовать отдельно собранные доменные и языковые данные, не создавая для каждого языка новый мультимодальный набор.

Языковой и доменный адаптеры учат раздельным навыкам

В основе MODL лежат два LoRA-адаптера. LoRA — это небольшой набор обучаемых параметров, который меняет поведение замороженной модели без повторного обучения всех её весов.

Первый адаптер учится работать со спутниковыми и аэрофотоснимками по англоязычным инструкциям. Второй получает только текстовые инструкции на целевом языке — без изображений и без материалов по дистанционному зондированию.

Эти потоки не связывают искусственными парами. Во время обучения модель попеременно видит английские задания с изображениями и обычные текстовые задания на испанском, вьетнамском или другом языке. При использовании оба адаптера просто добавляют к базовой модели: определять язык запроса и переключать модули не нужно.

Простого совместного обучения оказалось недостаточно. Доменный навык сохранялся, но изображение заставляло модель переходить на английский. Одновременно она хуже справлялась с обычными текстовыми заданиями на целевом языке.

MODL добавляет к функции потерь требование взаимной ортогональности. Обновления двух адаптеров должны занимать разные направления в пространстве параметров на каждом слое и на протяжении всего обучения. Это не даёт доменному адаптеру перезаписывать языковой навык, а языковому — вмешиваться в обработку изображений.

Ортогональность устранила переход на английский

Главная метрика одновременно проверяла два условия: модель назвала правильный класс сцены и сделала это на языке запроса. Ближайшая альтернатива достигла 27%, а большинство способов объединить адаптеры осталось ниже 8%. Разрыв между MODL и обычным совместным обучением статистически значим.

На испанской классификации MODL получил 58,2% против 53,6% у Qwen2.5-VL-7B. Сравнение не означает общего превосходства над Qwen: речь идёт об одной задаче на снимках и о способности отвечать именно на испанском.

Ограничение в пространстве параметров также сохранило текстовые способности базовой модели. Функциональная альтернатива Fic пыталась удержать прежнее поведение на обучающих примерах, но не устранила переход на английский. Ранее предложенные способы ортогонального обучения тоже не помогли: сработало именно симметричное разделение двух адаптеров на каждом шаге.

Без ограничения один из трёх основных запусков Joint разошёлся. Все запуски MODL остались стабильными, хотя обучение проходило без обрезки градиентов. Это наблюдение нельзя автоматически переносить на другие режимы оптимизации, но оно показывает, что разделение адаптеров влияет не только на итоговый ответ, но и на ход обучения.

Метод меняет планы там, где данные разделены по домену и языку

Работа предлагает практическую схему для продукта, у которого уже есть англоязычная мультимодальная модель и отдельный корпус текстовых инструкций на нужном языке. Вместо перевода всех изображений, вопросов и ответов команда может обучить доменный и языковой адаптеры вместе, сохраняя исходные наборы раздельными.

Это меняет архитектурный план сильнее, чем план сбора данных. Языковой модуль нельзя обучить независимо, а затем без проверки сложить с доменным: протестированные способы такого объединения переносили знание задачи, но часто теряли язык ответа. Ортогональность нужно заложить в совместное обучение адаптеров с самого начала.

Проверка охватывала LLaVA-1.5-7B, классификацию сцен дистанционного зондирования и языки с разной письменностью: испанский, вьетнамский, арабский, хинди и суахили. Все системы получили одинаковый бюджет в 1000 шагов, а основные сравнения повторяли с разными начальными состояниями. Тестовые задания переводили машинно, без проверки носителями языка.

Граница метода проходит по письменности и исходным знаниям модели. Один общий адаптер сохранил результаты на английском, испанском и вьетнамском, но просел на арабском, хинди и суахили. Отдельные языковые адаптеры улучшили арабский и хинди, однако всё равно заметно уступили языкам на латинице; для суахили правильные ответы на нужном языке остались редкими.

Поэтому MODL уже даёт основание отказаться от обязательного создания парных мультимодальных данных для каждого языка, но не от языковой проверки продукта. Перед внедрением придётся отдельно измерять правильность ответа, соблюдение языка и сохранность исходных текстовых навыков — одной общей метрики качества недостаточно.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу