跳转到主要内容

阿里甩出Qwen3.8-Omni-Flash:音频成本暴降98%,多模态战火重燃

阿里再出手:Qwen3.8-Omni-Flash 把多模态和智能体揉到了一起

阿里通义千问团队最近发布了新一代原生多模态模型 Qwen3.8-Omni-Flash。跟上一代 Qwen3.5-Omni-Plus 比,官方说在 29 项基准测试里平均提升了 25% 以上。

这次最大的变化不是功能变多了,而是处理方式变了——不再是把语音识别和图像识别简单拼在一起,而是在模型底层原生处理不同类型的信息。说白了,阿里想让这个模型不光“看懂”音频视频,还要在看懂之后自己规划任务、调用工具、把活干完。

Image

音频是它的主场,但视频上 Gemini 还压着一头

音频能力是 Qwen3.8-Omni-Flash 最拿得出手的地方。在 WildClawBench-MM 多模态工具调用测试里,它拿了 71.0 分,Gemini3.8Flash 是 58.9;DailyOmni 上 85.1 对 84.0;SpotSoundBench 上 67.2 对 39.7;MMAU 上 81.8 对 76.9——四项全胜。

多说话人会议识别进步更夸张。AliMeeting 测试里,说话人错误率(DER)从前代的 88.11 掉到 3.35,带说话人归属的词错误率(cpWER)从 89.61 降到 17.18。不过它也不是全面领先——AgenticVBench 上 Gemini3.8Flash 拿了 45.0,Qwen 是 36.8;OmniGAIA 上 78.6 对 74.0,部分视频理解测试里 Gemini 依然占优。所以“逼近 Gemini”这个说法,主要还是在音频和音视频综合能力上成立。

真正可能改写玩法的,是价格

Qwen 声称音频输入的每小时预估成本降了 98% 以上,音视频混合输入降了 93% 以上。按官方口径,小时成本按处理两分钟素材价格的 30 倍计算,视频输入是 720p、每秒一帧。阿里云国际站定价为每百万输入 token 0.15 美元,每百万缓存输入 token 0.016 美元,每百万输出 token 0.47 美元,中国大陆和部分其他地区价格有所不同。

配上 100 万 token 的上下文窗口(最大输入接近 992,000,思考模式下约 984,000,最大输出 131,000),开发者可以直接把海量音频或视频喂给模型,不用频繁切片、抽帧或者串联多个模型。它还支持 113 种语言和方言的音频输入,能分析立体声和 4 声道空间音频,并提供函数调用、联网搜索和上下文缓存。

应用方向:让智能体把活干完

通义团队把重点放在了“智能体交付”上——模型可以分析长视频、定位关键内容,然后用工具做视频剪辑、内容整理、会议纪要和字幕生成。配套工具包括用于多模态智能体开发的 Qwen-MM-Plugins,还计划推出 Qwen-Live-Harness。

目前 Qwen3.8-Omni-Flash 已通过阿里云百炼平台开放,覆盖北京、新加坡、香港、东京、法兰克福和弗吉尼亚等区域。模型本身没有直接开源,这次主要开放的是配套的多模态插件和开发工具。

如果音频成本真能降 98% 以上,那长会议、播客、直播和海量视频素材的自动分析就会变得极其便宜。Qwen 和 Google Gemini 在多模态领域的贴身肉搏,恐怕又要升级了。

Key Points

  • 原生多模态:Qwen3.8-Omni-Flash 在模型底层统一处理文本、图像、音频和视频,而非简单拼接。
  • 音频强势:四项音频基准测试全面领先 Gemini3.8Flash,会议识别错误率大幅下降。
  • 成本暴降:音频输入成本降低超 98%,音视频混合输入降低超 93%。
  • 百万上下文:支持 100 万 token 上下文窗口,可直接处理超长音视频。
  • 智能体交付:配套 Qwen-MM-Plugins 等工具,瞄准视频编辑、会议纪要等自动化场景。
  • 视频短板:部分视频理解测试仍落后于 Gemini,竞争远未结束。