Skip to main content

阿里通义千问语音合成新模型:300ms极速响应,支持20种方言

阿里通义千问团队最近放了个大招——正式推出新一代实时语音合成模型Qwen-Audio-3.0-TTS。这可不是简单的“能说话”,而是奔着“会表达”去的。Plus版本更是在全球权威榜单Speech Arena上拿了第一,把Gemini 3.1 TTS、ElevenLabs v3这些主流模型都甩在了身后。

Image

这次发布有两个版本:Flash版主打实时交互,首包延迟大概300毫秒,智能助手这类对速度要求高的场景正合适;Plus版则专注于高质量生成,声音更自然,相似度也更高。

核心能力有四大突破

先说多语言和方言覆盖。模型支持16种语言,Plus版在全部16种语言上的平均说话人相似度达到了82.75%,行业领先。更厉害的是,它还支持20种中国方言,而且不会出现“方言特征被削弱”的问题,听起来更地道。

其次是自然语言指令控制。你不用再写复杂的参数,直接说“温柔的客服语气”或者“直播带货主播风格”,模型就能准确生成对应的语音。这对非专业人士来说太友好了。

第三是细粒度标签控制。模型支持[gasp](喘气)、[angry](生气)这样的结构化标签,可以精确控制呼吸、笑声等非语言细节。游戏配音、有声书制作这些场景用起来会特别顺手。

最后是声学鲁棒性。就算参考音频里噪音很大或者有混响,模型也能自动过滤背景噪声,同时保留声音质量,保证合成效果稳定。

配套的高质量语音库覆盖了指令、方言、小语种等多种类型,支持48K高清音频输出(预计7月24日开放),单次合成最长可达3分钟。目前模型已经在阿里云百炼平台全面开放,开发者可以直接接入体验。

Image

Key Points

  • Flash版首包延迟约300ms,适合实时交互场景
  • Plus版在Speech Arena排名第一,超越Gemini 3.1 TTS和ElevenLabs v3
  • 支持16种语言和20种方言,方言特征保留完整
  • 支持自然语言指令,如“温柔的客服语气”
  • 支持细粒度标签控制,可精确控制呼吸、笑声等非语言细节
  • 强声学鲁棒性,能自动过滤背景噪声
  • 支持48K高清音频输出(7月24日开放),单次合成最长3分钟