Журнал · Rit.work

Qwen представила Qwen3.8-Omni-Flash для работы с видео и инструментами

Модель получила контекст на 1 млн токенов, приблизилась к Gemini 3.8 Flash в работе с аудио и видео и сократила стоимость видеовхода относительно Qwen3.5-Omni-Plus.

Дежурный по новостям
Автоматический обзор · Rit.work
18 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Qwen представила Qwen3.8-Omni-Flash — модель, которая совместно анализирует изображение и звук, планирует действия и вызывает внешние инструменты. Она рассчитана на автоматический монтаж влогов, перевод коротких роликов, пересказ фильмов и поиск фрагментов в длинных записях через API.

По данным Qwen, модель приблизилась к Gemini 3.8 Flash по работе с аудио и видео, а видеовход стоит примерно на 89% меньше, чем у Qwen3.5-Omni-Plus. Это делает Qwen3.8-Omni-Flash кандидатом для прототипов, где прежняя модель обходилась слишком дорого, но исходный пост не даёт абсолютных цен и полной таблицы результатов.

Модель объединяет просмотр видео и выполнение задачи

Qwen3.8-Omni-Flash получила встроенное понимание аудио и видео, рассуждение и работу с инструментами. Вместо отдельной цепочки из распознавания речи, анализа кадров и управляющей модели разработчик может передать задачу одной модели: она должна понять запись, составить план, вызвать нужные инструменты и собрать результат.

Qwen показывает три прикладных сценария. Модель может выбрать фрагменты для влога, перевести короткое видео или превратить фильм в краткий пересказ. Речь идёт не только о текстовом описании записи: модель должна управлять инструментами в длинной последовательности действий.

Для таких сценариев доступен контекст на 1 млн токенов. Контекстное окно определяет, какой объём входных данных модель может учитывать в рамках одной задачи. Само по себе большое окно не гарантирует, что модель найдёт нужный эпизод, поэтому Qwen отдельно выделяет активный просмотр: модель исследует запись и выбирает значимые моменты, а не обрабатывает всё одинаково.

На OmniVideoBench такой подход потребовал на 51,8% меньше токенов, чем статический анализ. Токены здесь выступают единицами обрабатываемого контекста: чем их меньше, тем ниже вычислительная нагрузка и потенциальный счёт за API при той же задаче.

Сравнение с Qwen3.5 и Gemini пока несимметрично

Для Qwen3.5-Omni-Plus компания приводит прямое сравнение стоимости. Обработка видеовхода в новой модели дешевле примерно на 89%, то есть требует около одной девятой прежних расходов при сопоставимом объёме входа. Абсолютной цены за токены в тексте поста нет, поэтому посчитать бюджет конкретного архива записей по этим данным нельзя.

С Gemini 3.8 Flash сравнение относится к качеству обработки аудио и видео. Qwen говорит, что новая модель приблизилась к уровню Gemini, но не приводит в тексте разрыв по отдельным тестам. Это позволяет считать Gemini ориентиром для заявленного качества, но не подтверждает равенство моделей в монтаже, переводе или поиске сцен.

В агентных тестах WildClawBench-MM и UniClawBench средний результат вырос на 19,5 пункта. Эти тесты проверяют, как модель выполняет задачи с несколькими действиями и инструментами. Пост не уточняет базовую модель для этого прироста, поэтому число показывает масштаб заявленного улучшения, но не даёт прямого сравнения с Qwen3.5-Omni-Plus или Gemini 3.8 Flash.

Что меняется для команд, которые строят обработку видео

Главное изменение — экономика длинных записей. Если значительную часть счёта создаёт видеовход Qwen3.5-Omni-Plus, заявленное сокращение стоимости позволяет либо уменьшить расходы, либо анализировать больше материала в прежнем бюджете. Дополнительная экономия токенов при активном просмотре особенно относится к поиску эпизодов, подготовке пересказов и разбору архивов.

Единая модель также сокращает число компонентов в первой версии продукта. Для прототипа перевода или автоматического монтажа не обязательно заранее строить отдельный управляющий слой между анализом видео и внешними инструментами: Qwen3.8-Omni-Flash берёт планирование и вызовы на себя. При этом качество итогового ролика всё равно зависит от подключённых инструментов, потому что модель ими управляет, а не заменяет видеоредактор.

Qwen открыла код Qwen-MM-Plugins для подключения мультимедийных инструментов и анонсировала Qwen-Live Harness. Саму модель предлагают через API, Qwencloud и Qwen Studio. Практический следующий шаг для существующего проекта — сравнить на собственных записях стоимость видеовхода, точность найденных моментов и устойчивость длинной цепочки действий: опубликованные показатели описывают направление улучшения, но не заменяют такой прогон.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Дежурный по новостям

Автоматический обзор · Rit.work

Материалы этого автора собирает наш конвейер: он следит за каналами исследовательских лабораторий, читает первоисточники и пересказывает главное по-русски. То, что пишут люди, подписано студией.

Ко всем материалам
Понравилось? Обсудим вашу задачу