Alibaba выпускает Qwen3.8-Omni-Flash, по своим характеристикам приближаясь к Gemini 3.8 Flash

📅 2026-09-18

Аннотация:

Команда Qwen из Alibaba недавно выпустила новое поколение собственной полномодальной модели Qwen3.8-Omni-Flash, которая еще больше сочетает в себе понимание аудио и видео с возможностями агента искусственного интеллекта.

Модель поддерживает четыре формы ввода: текст, изображение, аудио и видео, а также предоставляет контекстное окно на 1 миллион токенов. По сравнению с Qwen3.5-Omni-Plus предыдущего поколения, представители Qwen утверждают, что его средний балл в 29 тестах производительности увеличился более чем на 25%, при этом значительно сократились затраты на обработку аудио и аудио и видео.

1789705181_banner-latest.en.webp

Одним из самых больших изменений в Qwen3.8-Omni-Flash является то, что он не просто объединяет распознавание речи, распознавание изображений и другие возможности, а вместо этого естественным образом обрабатывает различные типы информации с уровня модели. Alibaba надеется использовать это, чтобы дать возможность модели не только «понимать» или «понимать» аудио- и видеоконтент, но и дальше планировать задачи, вызывать инструменты и завершать реальную работу после понимания этой информации.

Что касается аудиовозможностей, производительность Qwen3.8-Omni-Flash особенно выдающаяся. Согласно данным, опубликованным Qwen, эта модель превзошла Gemini 3.8 Flash в некоторых тестах производительности звука. Например, в мультимодальном тесте вызова инструментов WildClawBench-MM Qwen3.8-Omni-Flash набрал 71,0 балла, а Gemini 3.8 Flash — 58,9 балла; в тесте DailyOmni Квен набрала 85,1 балла, а Близнецы — 84,0 балла; в SpotSoundBench они набрали 67,2 балла и 39,7 балла соответственно; в тесте ММАУ они набрали 81,8 балла и 76,9 балла.

Распознавание речи в конференции с несколькими докладчиками также является основной задачей этого обновления. Данные испытаний AliMeeting, опубликованные Qwen, показывают, что частота ошибок динамика DER у Qwen3.8-Omni-Flash составляет 3,35, а частота ошибок в словах cpWER с атрибуцией говорящего составляет 17,18, тогда как у Qwen3.5-Omni-Plus предыдущего поколения — 88,11 и 89,61 соответственно. Это означает, что новая модель существенно изменится в этом тесте.

Однако Qwen3.8-Omni-Flash не опережает Gemini 3.8 Flash не во всех проектах. Например, в тесте AgenticVBench Gemini 3.8 Flash набрал 45,0 балла, а Qwen — 36,8 балла; в OmniGAIA они набрали 78,6 и 74,0 балла соответственно. В некоторых тестах на понимание видео Gemini также сохранила свое преимущество. Поэтому акцент Qwen на «приближении к Gemini» больше отражается на общих аудио- и аудио- и видеовозможностях и не означает общего лидерства во всех мультимодальных проектах.

Еще одно важное изменение в Qwen3.8-Omni-Flash — цена. Qwen заявляет, что расчетная стоимость часа аудиовхода снизилась более чем на 98%, а стоимость часа аудиовхода и видеовхода снизилась более чем на 93% по сравнению с предыдущей моделью. Согласно официальной методике расчета, так называемая «почасовая» стоимость рассчитывается путем умножения стоимости обработки двух минут материала на 30, при котором видео принимает входное условие 720p и 1 кадр в секунду.

Текущая международная региональная цена, объявленная Alibaba Cloud, составляет 0,15 доллара США за миллион входных токенов, входной токен, попадающий в кеш, составляет 0,016 долларов США, а выходной токен за миллион составляет 0,47 долларов США. Цены в материковом Китае и некоторых других регионах будут различаться. Поскольку аудио и видео можно использовать непосредственно в качестве входных данных модели, такая структура ценообразования особенно подходит для таких сценариев, как запись собраний, длительный аудиоанализ, обзор видео, создание субтитров и обработка больших объемов медиаконтента.

Контекстное окно «1 миллион токенов» еще больше усиливает это преимущество. Максимальная длина ввода Qwen3.8-Omni-Flash близка к 992 000 токенов, максимальная длина ввода в режиме мышления составляет примерно 984 000 токенов, а максимальная длина вывода достигает 131 000 токенов. Это означает, что разработчики могут напрямую передавать очень крупный аудио- или видеоконтент в модель для обработки без необходимости часто нарезать и извлекать кадры, как это было раньше, а затем использовать несколько моделей для завершения распознавания речи, визуального понимания и рассуждения текста соответственно.

Официальная информация Alibaba Cloud показывает, что Qwen3.8-Omni-Flash может обрабатывать аудиовход на 113 языках и диалектах и ​​поддерживает пространственный анализ звука. Благодаря соответствующим параметрам модель может обрабатывать двухканальный стереофонический и четырехканальный пространственный звук. В то же время модель поддерживает вызов функций, сетевой поиск, кэширование контекста и другие возможности и может напрямую использоваться в более сложных рабочих процессах агентов.

С точки зрения направления приложения на этот раз команда Qwen сосредоточилась на «интеллектуальной доставке». Например, модель может анализировать длинные видеоролики, находить ключевой контент и дополнительно вызывать инструменты для выполнения таких задач, как редактирование видео, организация контента, сводка встреч и создание субтитров. Qwen также анонсировала Qwen-MM-Plugins для разработки мультимодальных агентов и планирует запустить Qwen-Live-Harness, чтобы помочь разработчикам в дальнейшем создавать приложения интеллектуальных агентов на основе аудио- и видеовхода.

По сравнению с предыдущим поколением Qwen3.5-Omni, цель этого обновления — не просто повысить точность распознавания в традиционном смысле, но и попытаться изменить способ использования аудио и видео AI. Раньше мультимодальные приложения обычно требовали извлечения видеокадров и расшифровки аудио, а затем передачи различных результатов в языковую модель для обработки; Qwen3.8-Omni-Flash пытается максимально унифицировать эти ссылки в собственную полномодальную модель и использует 1 миллион контекстов токенов для непосредственной обработки более длинного исходного контента.

Qwen3.8-Omni-Flash в настоящее время предоставляет услуги через Alibaba Cloud Bailian, поддерживая такие регионы, как Пекин, Сингапур, Гонконг, Китай, Токио, Япония, Франкфурт, Германия, и Вирджиния, США. В самой модели гири не открываются напрямую, как в некоторых предыдущих моделях Qwen. На этот раз Alibaba в основном открывает поддерживающие мультимодальные плагины и соответствующие инструменты разработки.

В целом, суть этого обновления Qwen3.8-Omni-Flash заключается не только в улучшении показателей работы модели, но и в одновременном снижении затрат на обработку басового видео, расширении масштаба контекста и объединении понимания аудио и видео с вызовом инструментов. В частности, стоимость аудиовхода была снижена более чем на 98%. Если фактическая стоимость использования сможет достичь официального расчетного уровня, это облегчит крупномасштабный автоматический анализ долгосрочных записей встреч, подкастов, прямых трансляций и видеоматериалов и еще больше усилит конкуренцию между Qwen и мультимодальными моделями, такими как Google Gemini.

Связанные теги

Похожие статьи

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев