Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Совместное рассуждение по аудио и видео удалось улучшить без основного обучения на таких данных. Хотя препринт не прошёл рецензирование и числа получили сами авторы, на Qwen2.5-Omni-7B геометрическое среднее оценок выросло на 25,83%, а обучение потребовало на 56,6% меньше GPU-часов, чем полный аудиовизуальный маршрут. Практический вывод — рассуждение и восприятие можно дообучать последовательно, а не пытаться улучшить одним дорогим набором данных.
Модель видит отдельные факты, но не связывает их
Команда Shanghai Jiao Tong University сначала проверила, действительно ли ошибки вызваны восприятием. Для девяти Omni-LLM составили простые вопросы по реальным аудиовизуальным материалам, а затем оставили факты, которые все модели распознали правильно.
Из этих фактов собрали задачи, где ответ требовал двух или трёх последовательных шагов. Точность на исходных вопросах составила 94,7%, но на составных упала до 64,1% и 62,3%. Значит, модель могла отдельно определить событие в кадре и источник звука, но ошибалась, когда требовалось связать их во времени.
Затем авторы проверили, можно ли менять рассуждение и восприятие разными обновлениями весов. На Qwen2.5-Omni-3B они вычисляли направление градиента для каждой способности и проецировали его так, чтобы первое обновление как можно меньше затрагивало вторую цель.
Разделение оказалось неполным, но полезным: направленное обновление сохраняло большую часть улучшения целевой способности и слабее меняло другую. Это локальный результат для конкретного состояния модели, а не доказательство, что внутри неё существуют независимые модули восприятия и рассуждения. Но его достаточно, чтобы проверить поэтапную схему обучения.
Текст улучшает рассуждение, аудио и видео возвращают восприятие
Основной эксперимент начинался с одной базовой Qwen2.5-Omni-7B. В текстовом маршруте модель сначала дообучали на размеченных примерах с ходом решения, затем применяли GRPO — обучение с подкреплением, которое сравнивает несколько ответов на один запрос и усиливает более удачные.
Лучше всего сработали текстовые описания сценариев и вопросы с вариантами ответа. Такой формат сохранял структуру мультимодальной задачи: несколько событий, временные связи и факты из разных источников. При этом на вход обучения не требовалось подавать аудио или видео.
Отдельный опыт убрал даже зависимость от сценариев, полученных из мультимодальных материалов. Текстовая LLM придумала вымышленные эпизоды, вопросы и объяснения; обучение на этом синтетическом наборе подняло геометрическое среднее результатов на 21,01%. Эта метрика объединяет оценки по разным задачам и сильнее наказывает маршрут, который улучшил одни проверки ценой провала на других.
У текстового этапа обнаружилась ожидаемая цена: модель стала хуже извлекать сведения непосредственно из аудио и видео. Поэтому после него добавили сокращённое аудиовизуальное обучение с подкреплением. Оно использовало примерно на 90% меньше входных токенов, чем полный мультимодальный этап, подняло восприятие выше базового уровня и сохранило 93,5% прибавки в рассуждении.
GPU-часы в работе учитывают и генерацию ответов во время GRPO, и обновление модели. Входные токены считают без заполнителей пакета, но включают позиции, в которые разворачиваются аудио и видео. Поэтому сравнение отражает вычислительную нагрузку всего обучения, а не только объём исходных файлов.
Когда эта схема меняет план разработки
Для команды, которая дообучает Omni-LLM под собственные процессы, работа предлагает изменить порядок расходов. Большой текстовый набор можно использовать как основной источник задач на причинные, временные и межмодальные связи. Аудиовизуальные примеры тогда нужны не для всего цикла, а для заключительной настройки восприятия.
Такой план требует двух раздельных контуров проверки. Первый измеряет, умеет ли модель объединять уже распознанные факты. Второй проверяет, правильно ли она извлекает эти факты из записи. Одна сводная оценка скроет обмен между способностями: текстовый этап может улучшить итоговый ответ, одновременно ухудшив распознавание исходного события.
Основные замеры сделаны на Qwen2.5-Omni-7B; перенос дополнительно проверяли на меньших Qwen2.5-Omni, моделях Gemma-4 и более крупной Qwen3-Omni. В качестве сопоставления использовали исходные модели, полный аудиовизуальный маршрут и внешние мультимодальные модели. Проверки охватывали совместное рассуждение по звуку и видео, временные связи, социальные ситуации и отдельные задачи восприятия.
Работа меняет план прежде всего там, где узким местом стали подготовка согласованных аудиовизуальных примеров и стоимость их обучения. Она не отменяет такие данные: без заключительного этапа модель теряет точность восприятия. Но вместо единого мультимодального корпуса для всех целей команда может заложить текстовый основной этап и меньший набор нативных записей для коррекции.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



