Qwen新Omni模型支持1M上下文,性能提升26%
Qwen3.8-Omni-Flash发布,支持1M上下文并带来巨大性能提升
9月18日,Qwen推出了其最新的原生多模态模型Qwen3.8-Omni-Flash,并已在Qwen AI平台上开放测试。该模型不仅能处理文本,还能接收图像、音频和视频,同时支持庞大的100万token上下文窗口。这提供了巨大的处理空间。
但它实际能做什么?除了常规的编程和GUI任务外,Qwen3.8-Omni-Flash专注于音频和视频工作流。例如视频编辑、MV创作、电影制作和评论、音视频转文本摘要,甚至关于音视频内容的对话。这些任务需要严肃的多模态处理,而Qwen正将该模型定位为此类任务的首选。
基准测试:平均跃升26%
在30项评估中,该模型平均得分比前代Qwen3.5-Omni-Plus高出超过26%。在音频-视觉代理、编码和长期任务等特定领域,改进更为显著:
- WildClawBench-MM提升了36.5分
- AgenticVBench攀升22.3分
- UniClawBench达到69.6分
在基础能力方面,LongAudioSpan提升了8.3分,OmniVideoBench提升了9.6分,而OmniCap-IF的CSR/ISR分别提高了8.5和14.1分。或许最令人印象深刻的是:AliMeeting上的DER/cpWER从糟糕的88.11/89.61降至仅3.35/17.18。这不是笔误——这是准确性的巨大飞跃。

引人注目的定价
Qwen声称该模型的音频和视频能力接近Gemini3.8Flash,整体音频性能实际上超过它。价格呢?非常激进。通过API进行音频输入的每小时成本下降了超过98%,而音频和视频输入价格下降了超过93%。对于开发者和企业来说,这是游戏规则的改变。

为长工作流和实时交互而构建
为了支持扩展工作流和实时交互,Qwen扩展了Qwen-MM-Plugins并开源了Qwen-Live Harness。在Agentic Understanding模式下,OmniVideoBench准确率从63.4上升到67.8,而token消耗从145,736下降到79,117——减少了约45.7%。更少的计算,更好的结果。

帮助构建自身的模型
一个有趣的转折是,团队在自身的研发过程中使用了该模型。他们在12小时内完成了评估集选择、数据构建和四次迭代,构建了3,413条训练数据。这种自我改进循环帮助将Qwen2.5-Omni-3B中四川方言识别的字符错误率从25.79%降低到15.30%——相对下降了约40.7%。
同时发布的还有Realtime版本,Qwen称这是首个支持“声音定位”的全模态大模型。这意味着它不仅能识别声音是什么,还能定位声音来自哪里。
关键要点
- Qwen3.8-Omni-Flash支持文本、图像、音频和视频输入,具有1M上下文窗口。
- 在30项评估中,与上一代相比平均基准提升超过26%。
- 在音频-视觉代理、编码和长期任务中显著提升。
- 音频输入的API定价下降了超过98%;音频/视频输入下降了超过93%。
- 开源了Qwen-Live Harness并扩展了Qwen-MM-Plugins以支持长工作流。
- 模型用于自身研发,将四川方言错误率降低了约40.7%。
- Realtime版本引入了“声音定位”能力。
通过这些更新,Qwen显然正在推动多模态模型的能力边界——并在此过程中使其更加经济实惠。