阿里巴巴 Qwen 发布五款语音模型,大幅降低 TTS 和 ASR 价格
阿里巴巴 Qwen 发布五款语音模型,大幅降低 TTS 和 ASR 价格
9 月 23 日,阿里巴巴 Qwen 团队揭开了其音频工具包的重大升级,在 Qwen-Audio-3.1 旗下推出了五款新的语音模型。这些模型覆盖了整个音频频谱——从识别和合成到实时交互和创意音频生成。而定价呢?它改变了游戏规则:文本转语音(TTS)成本降低了约 70%,实时服务降低了 85%,自动语音识别(ASR)降低了惊人的 95%。此举使开发者能够以前所未有的低成本获得先进的语音能力。
理解上下文的语音识别
此次更新的核心是 Qwen-Audio-3.1-ASR,这是一款新一代语音识别模型,它不仅转录,还能理解。其突出功能是原生转录润色,可自动删除填充词、消除重复,并重构句子以获得更流畅、更合逻辑的输出。基于角色的转录能准确识别谁在何时说了什么,非常适合会议、访谈和对话分析。系统输出说话人标签、时间戳和文本,轻松处理打断和重叠语音。
但这不仅仅是英语。该模型支持 30 种语言和 16 种中文方言,能识别行业术语和热词,并在长音频上下文中保持术语一致。首词响应延迟仅为 160 毫秒,实时转录感觉无缝。性能指标令人印象深刻:在公开方言数据集上,平均词错误率为 4.55%,在内部测试中,16 种中文方言的词错误率为 10.38%。即使是像温州话这样具有挑战性的方言也看到了显著改进,将方言转换为普通话时的语义准确率达到 82.10%。

更进一步,Qwen-Audio-3.1-ASR-Next 将识别从单纯的语音扩展到完整的音频理解。它可以检测情绪、环境声音和机械噪音,执行声音描述、事件定位,甚至回答有关音频内容的问题。想象一段包含对话、背景音乐和环境噪音的剪辑——它不仅提供字幕,还告诉你存在哪些声音以及事件何时发生。在基于角色的 ASR 测试中,ASR-Flash-Next 和 ASR-Flash 分别在八项指标中的五项和三项中获得了最高分,超越了之前的基准。
具有真实表现力的语音合成
对于语音合成,Qwen-Audio-3.1-TTS 专注于自然表达,而不仅仅是发音准确性。它支持多语言和方言合成,实现跨语言的语音迁移,使用户能够立即说多种语言。您可以通过指令控制情绪、语速和表达,根据特定内容和场景定制语音。
真正的惊喜是 Qwen-Audio-3.1-TTS-Next,它将音频创作从单一语音合成提升为通用音频生成系统。以前,创建一个完整的音频作品需要一个团队——主持人、音响工程师、混音师、编辑。现在,一个模型可以根据文本、时间戳和参考音频生成人声、音效和环境声音。它支持多语音复制和多轮对话,保持每个角色的声音一致。它可以合并各种声音,添加材料、距离和空间的层次——想象一个播客,有叙述、双角色对话和背景城市嗡嗡声、晚风和易拉罐压碎声,使对话感觉就像发生在真实场景中。它还接受自然语言控制音调、速度、音量、音乐风格和乐器,具有细粒度时间戳和 48kHz 输出。这种精度满足了播客、有声读物、电影、游戏和广告的需求。

感觉像人类的实时交互
最后,Qwen-Audio-3.1-Realtime 打破了识别、建模和合成的分离链条。它以全双工模式运行,允许同时说话和聆听,因此用户可以随时打断或插话——就像真实对话一样。该模型不仅理解词语,还理解声音背后的情绪和意图。感觉到沮丧的语气?它不会机械地回复“我明白”,而是会放慢速度并调整措辞。它切换语言而不丢失上下文、语气或节奏。它避免捏造不确定信息,并尊重高风险内容的边界。使用多教师蒸馏架构,它在保持低延迟的同时提高了推理和安全性。此外,它可以在对话过程中调用 Agent 工具,访问 API、知识库和业务系统以检索和执行结果,并将其无缝集成回对话中。
要点
- 五款新模型 在 Qwen-Audio-3.1 下涵盖识别、合成、实时交互和音频创作。
- 降价:TTS 降低 70%,实时降低 85%,ASR 降低 95%。
- ASR 支持 30 种语言、16 种中文方言,具有上下文感知转录和角色标注。
- TTS 提供多语言合成、语音迁移和情绪控制;TTS-Next 实现全音频场景生成。
- Realtime 模型具有全双工对话、情绪理解和 Agent 工具集成。