跳转到主要内容

阿里巴巴Qwen3.8-Omni-Flash将音频成本降低98%

阿里巴巴的Qwen3.8-Omni-Flash:多模态强者,价格令人瞩目

阿里巴巴的Qwen团队悄然发布了一款新的原生多模态模型Qwen3.8-Omni-Flash,它引起了轰动——不仅因为它的功能,还因为它的成本之低。

一个模型,四种输入

忘掉将单独的语音和图像识别器拼接在一起吧。Qwen3.8-Omni-Flash原生处理文本、图像、音频和视频,全部在一个模型内完成。它带有100万token的上下文窗口——足以吞下整个会议或冗长的视频档案,而无需不断切片。与其前身Qwen3.5-Omni-Plus相比,阿里巴巴声称在29项基准测试中平均提升超过25%。

Image

音频:它的亮点

该模型的音频能力尤其令人印象深刻。在WildClawBench-MM多模态工具调用测试中,它得分71.0,击败了Gemini3.8Flash的58.9。在DailyOmni上,它以85.1比84.0险胜Gemini;在SpotSoundBench上,它以67.2比39.7占据主导;在MMAU上,它以81.8比76.9获胜。多说话人会议识别的提升更为显著:说话人错误率(DER)从前代的88.11骤降至3.35,带说话人归属的词错误率(cpWER)从89.61降至17.18。

但这并非全面胜利。在AgenticVBench上,Gemini得分45.0,而Qwen为36.8;在OmniGAIA上,Gemini以78.6比74.0领先。在一些视频理解任务中,Gemini仍保持优势。因此,虽然“接近Gemini”的说法在音频和音视频能力上成立,但并非普遍胜利。

价格冲击

这里有一个可能真正改变开发者工作方式的大标题:音频输入成本每小时下降超过98%,音视频组合输入下降超过93%。阿里云国际区域定价为每百万输入token 0.15美元,每百万缓存输入token 0.016美元,每百万输出token 0.47美元。如果这些数字成立,分析长会议、播客、直播和大量视频库将变得几乎微不足道地便宜。

为代理而建

Qwen3.8-Omni-Flash不仅仅是一个被动的倾听者。它可以规划任务、调用工具并完成工作。团队的目标是“代理交付”:该模型可以分析长视频, pinpoint关键时刻,然后使用工具编辑视频、组织内容、生成会议摘要和创建字幕。它处理113种语言和方言的音频,支持立体声和4声道空间音频分析,并提供函数调用、在线搜索和上下文缓存。

配套工具包括用于多模态代理开发的Qwen-MM-Plugins,Qwen-Live-Harness也即将推出。该模型可通过阿里云百炼在北京、新加坡、香港、东京、法兰克福和弗吉尼亚等地区使用。模型本身并未开源,但此次发布开放了配套的多模态插件和开发工具。

关键点

  • 原生多模态: 在一个模型中处理文本、图像、音频和视频,具有1M token上下文窗口。
  • 音频领先: 在四个关键音频基准测试中优于Gemini3.8Flash,在多说话人识别方面取得巨大进步。
  • 并非普遍: Gemini在一些视频和代理基准测试中仍领先。
  • 价格颠覆: 音频输入成本降低超过98%;音视频组合降低超过93%。
  • 代理就绪: 支持任务规划、工具调用和113种语言的音频输入。
  • 可用性: 可通过阿里云百炼在多个全球区域访问;插件和开发工具已开源。

如果成本降低持续,自动分析长会议、播客和视频档案的经济性将一夜之间改变。而Qwen与谷歌Gemini在多模态领域的竞争变得更加有趣。