Журнал · Rit.work

Qwen3.8-Omni переносит длинные аудио- и видеозадачи в контур агента

Qwen3.8-Omni-Flash работает с текстом, изображениями, аудио и видео в едином контексте, а открытые инструменты связывают модель с памятью, плагинами и другими агентами.

Rit.work
Студия разработки
23 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Мультимодальную модель научили планировать длинные задачи, вызывать инструменты и работать с текстом, изображениями, аудио и видео в едином процессе. В нерецензированном препринте, где все числа получили сами авторы, Qwen Team сообщает о приросте более 25% относительно Qwen3.5-Omni-Plus. Для разработки это сигнал, что аудио и видео переходят из отдельных распознавателей в основной контур агента.

Qwen3.8-Omni-Flash сводит входные данные разных типов в общую последовательность и сохраняет временные метки, чтобы связывать события в звуке и кадрах. Разреженная смесь экспертов выбирает для каждого фрагмента лишь часть специализированных блоков модели, а контекст на миллион токенов позволяет удерживать длинные записи и планы без постоянной нарезки на независимые запросы.

Модель дополняют два открытых проекта. Qwen-MM-Plugins превращает видео в подробные описания и структурированные заметки, загружает нужные фрагменты по запросу и собирает исполняемые навыки из видеоинструкций. Qwen-Live-Harness управляет контекстом, памятью, инструментами и передачей задач вспомогательным агентам в системах, которые отвечают в реальном времени.

Средний результат вырос более чем на 25% по 29 проверкам аудиорассуждений, работы с аудио и видео и агентных задач. Расчётные затраты API на входные данные относительно предшественника сократились более чем на 98% для аудио и на 93% для видео со звуком. Это оценка стоимости обработки входа, а не полная экономика приложения с генерацией, инструментами и хранением данных.

Проверки охватывают понимание и рассуждения по тексту, изображениям, аудио и видео, работу с интерфейсами, создание видеоматериалов и синтез речи. Модель сравнивали с Qwen3.5-Omni-Plus и профильными решениями других компаний; часть речевых наборов была внутренней. Практический вывод относится прежде всего к архитектуре: при выборе основы для мультимодального продукта теперь стоит оценивать не только качество модели, но и то, как она управляет памятью, выборочно читает длинные записи и передаёт работу инструментам.

Источники

Иллюстрация: рисунок из статьи «Qwen3.8-Omni: Towards Native Omni-Modal Agents», Qwen Team, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу