Журнал · Rit.work

Новая модальность без пересборки индекса: адаптеры с точным обходом

Модально-гейтируемые адаптеры добавляют аудио и тепловые изображения в замороженную модель, не меняя её прежние векторные представления.

Rit.work
Студия разработки
23 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Новую модальность научились добавлять в замороженную модель векторных представлений так, чтобы её прежние выходы не менялись ни на один бит. В нерецензированном препринте, где все числа получили сами авторы, полнота поиска тепловых изображений по тексту выросла более чем втрое. Для уже развёрнутой системы это позволяет сохранить индекс, пороги и проверки поведения модели при подключении нового типа данных.

Как адаптеры обходят старые пути модели

За основу взяли Qwen3-VL-Embedding-2B, которая уже обрабатывает текст, изображения и видео. Базовые параметры полностью заморозили, а к каждому из 28 слоёв декодера подключили небольшой адаптер: он сжимает скрытое представление, преобразует его и возвращает добавку в основной поток.

Ключевую роль играет не сам адаптер, а двоичный переключатель перед ним. Аудиовход открывает пакет аудиоадаптеров, тепловое изображение — отдельный пакет для этой модальности. Текст, обычные изображения и видео не открывают ни один пакет.

При закрытом переключателе обработчик возвращает исходный результат слоя до любых вычислений адаптера. Это не умножение добавки на ноль: дополнительная ветка вообще не попадает в граф вычислений. Модель выполняет те же операции над теми же параметрами в прежнем порядке, поэтому выдаёт тот же набор битов.

Каждая модальность получает собственный пакет. Если активен аудиопакет, загруженный рядом пакет для тепловых изображений остаётся невидимым, и наоборот. Так несколько расширений можно держать в одном процессе без взаимного влияния и без отдельной метки задачи в запросе: нужную ветку открывает точка входа для соответствующего типа данных.

Переключатель должен оставаться открытым не только во время прямого прохода, но и при обратном проходе. При повторном расчёте активаций слишком раннее закрытие исключит адаптеры из графа и испортит градиенты без явной ошибки. В опубликованной реализации область действия переключателя охватывает оба прохода, а тесты проверяют неизменность базовых параметров и точное совпадение выходов.

Добавочная ёмкость сработала внутри слоёв

Качество измеряли через полноту среди первых десяти результатов: как часто правильная пара попадала в верхнюю часть поисковой выдачи. В контролируемом опыте аудиоадаптеры прибавили от 3,4 до 5,4 пункта к поиску текста по аудио по сравнению с моделью, обученной на тех же данных с тем же входным соединителем. Эффект сохранялся при каждом проверенном начальном состоянии обучения.

Для тепловых изображений полнота поиска текста выросла с 0,224 до 0,785. Эта модальность проходит через замороженный зрительный тракт базовой модели, а не через аудиосоединитель, поэтому опыт проверяет тот же механизм на другом способе подачи данных.

Замена внешнего аудиокодировщика на вариант, который лучше выглядел в специализированных сравнениях, дала обратный эффект внутри замороженной LLM: результат снизился на 16 пунктов. Размеры кодировщиков не были выровнены, поэтому опыт не доказывает превосходство одного из них сам по себе. Он показывает более практичную вещь: место кодировщика во внешнем рейтинге не предсказывает качество всей составной системы, а недостающая ёмкость может находиться в слоях LLM.

Когда этот подход меняет архитектурный план

Работа касается систем, где выход модели уже стал контрактом. Если векторные представления лежат в поисковом индексе, а пороги сходства и проверки поведения настроены на их геометрию, обычная LoRA меняет функцию модели даже при замороженных базовых параметрах. Старые документы и новые запросы тогда кодируются разными версиями пространства, что ведёт к пересчёту индекса или параллельному запуску двух моделей.

Модальный переключатель отделяет расширение от прежних путей. Команда может обучить пакет для нового типа данных и оставить старые векторы действительными. Цена такого решения — отдельные параметры для каждой модальности: в аудиоконфигурации соединитель и адаптеры добавили около 3% обучаемых параметров относительно базы.

Гарантию стоит переносить в требования к реализации, а не считать свойством любого условного адаптера. Нужен ранний выход до вычислений дополнительной ветки, строгая область действия переключателя и тесты на побитовое равенство. Оно выполняется при одинаковых весах, точности, вычислительных ядрах и составе пакета; при смене оборудования модель сохраняет ровно ту же степень воспроизводимости, что и базовая версия.

Границы проверки узкие, но содержательные: одна базовая модель семейства Qwen, аудио и тепловые изображения, два одновременно загруженных пакета. Вход, который открыл бы оба пакета за один проход, не изучался. Смешанные запросы с новой модальностью тоже относятся к новому поведению, поэтому гарантия охватывает прежние текстовые, визуальные и видеовходы, а не любую возможную последовательность.

Если продукт допускает замену пространства и плановую пересборку индекса, работа не показывает, что гейтируемые адаптеры обязательно лучше полного обновления. Но при требовании сохранить действующий индекс она предлагает проверяемую архитектурную границу: новая модальность получает ёмкость внутри модели, а старые пути физически обходят её.

Источники

Иллюстрация: рисунок из статьи «Modality-Gated Deep Adapters: Adding a Modality to a Frozen Embedding Model with Exact Preservation», Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу