Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Новую модальность научились добавлять в замороженную модель векторных представлений так, чтобы её прежние выходы не менялись ни на один бит. В нерецензированном препринте, где все числа получили сами авторы, полнота поиска тепловых изображений по тексту выросла более чем втрое. Для уже развёрнутой системы это позволяет сохранить индекс, пороги и проверки поведения модели при подключении нового типа данных.
Как адаптеры обходят старые пути модели
За основу взяли Qwen3-VL-Embedding-2B, которая уже обрабатывает текст, изображения и видео. Базовые параметры полностью заморозили, а к каждому из 28 слоёв декодера подключили небольшой адаптер: он сжимает скрытое представление, преобразует его и возвращает добавку в основной поток.
Ключевую роль играет не сам адаптер, а двоичный переключатель перед ним. Аудиовход открывает пакет аудиоадаптеров, тепловое изображение — отдельный пакет для этой модальности. Текст, обычные изображения и видео не открывают ни один пакет.
При закрытом переключателе обработчик возвращает исходный результат слоя до любых вычислений адаптера. Это не умножение добавки на ноль: дополнительная ветка вообще не попадает в граф вычислений. Модель выполняет те же операции над теми же параметрами в прежнем порядке, поэтому выдаёт тот же набор битов.
Каждая модальность получает собственный пакет. Если активен аудиопакет, загруженный рядом пакет для тепловых изображений остаётся невидимым, и наоборот. Так несколько расширений можно держать в одном процессе без взаимного влияния и без отдельной метки задачи в запросе: нужную ветку открывает точка входа для соответствующего типа данных.
Переключатель должен оставаться открытым не только во время прямого прохода, но и при обратном проходе. При повторном расчёте активаций слишком раннее закрытие исключит адаптеры из графа и испортит градиенты без явной ошибки. В опубликованной реализации область действия переключателя охватывает оба прохода, а тесты проверяют неизменность базовых параметров и точное совпадение выходов.
Добавочная ёмкость сработала внутри слоёв
Качество измеряли через полноту среди первых десяти результатов: как часто правильная пара попадала в верхнюю часть поисковой выдачи. В контролируемом опыте аудиоадаптеры прибавили от 3,4 до 5,4 пункта к поиску текста по аудио по сравнению с моделью, обученной на тех же данных с тем же входным соединителем. Эффект сохранялся при каждом проверенном начальном состоянии обучения.
Для тепловых изображений полнота поиска текста выросла с 0,224 до 0,785. Эта модальность проходит через замороженный зрительный тракт базовой модели, а не через аудиосоединитель, поэтому опыт проверяет тот же механизм на другом способе подачи данных.
Замена внешнего аудиокодировщика на вариант, который лучше выглядел в специализированных сравнениях, дала обратный эффект внутри замороженной LLM: результат снизился на 16 пунктов. Размеры кодировщиков не были выровнены, поэтому опыт не доказывает превосходство одного из них сам по себе. Он показывает более практичную вещь: место кодировщика во внешнем рейтинге не предсказывает качество всей составной системы, а недостающая ёмкость может находиться в слоях LLM.
Когда этот подход меняет архитектурный план
Работа касается систем, где выход модели уже стал контрактом. Если векторные представления лежат в поисковом индексе, а пороги сходства и проверки поведения настроены на их геометрию, обычная LoRA меняет функцию модели даже при замороженных базовых параметрах. Старые документы и новые запросы тогда кодируются разными версиями пространства, что ведёт к пересчёту индекса или параллельному запуску двух моделей.
Модальный переключатель отделяет расширение от прежних путей. Команда может обучить пакет для нового типа данных и оставить старые векторы действительными. Цена такого решения — отдельные параметры для каждой модальности: в аудиоконфигурации соединитель и адаптеры добавили около 3% обучаемых параметров относительно базы.
Гарантию стоит переносить в требования к реализации, а не считать свойством любого условного адаптера. Нужен ранний выход до вычислений дополнительной ветки, строгая область действия переключателя и тесты на побитовое равенство. Оно выполняется при одинаковых весах, точности, вычислительных ядрах и составе пакета; при смене оборудования модель сохраняет ровно ту же степень воспроизводимости, что и базовая версия.
Границы проверки узкие, но содержательные: одна базовая модель семейства Qwen, аудио и тепловые изображения, два одновременно загруженных пакета. Вход, который открыл бы оба пакета за один проход, не изучался. Смешанные запросы с новой модальностью тоже относятся к новому поведению, поэтому гарантия охватывает прежние текстовые, визуальные и видеовходы, а не любую возможную последовательность.
Если продукт допускает замену пространства и плановую пересборку индекса, работа не показывает, что гейтируемые адаптеры обязательно лучше полного обновления. Но при требовании сохранить действующий индекс она предлагает проверяемую архитектурную границу: новая модальность получает ёмкость внутри модели, а старые пути физически обходят её.
Источники
Иллюстрация: рисунок из статьи «Modality-Gated Deep Adapters: Adding a Modality to a Frozen Embedding Model with Exact Preservation», Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



