阿里云发布Qwen-Audio-3.0-ASR-Flash:让语音识别告别“听不懂”
7月31日,阿里云通义千问正式发布了新一代语音识别大模型Qwen-Audio-3.0-ASR-Flash,并已在阿里云百炼平台上线。这款模型号称“长音频不漏字、行业术语不用教”,直击专业场景中语音识别的两大痛点。
五大升级,解决专业场景痛点
长音频记忆,告别“碎片化”
以往识别长音频时,模型往往“记性不好”,前后文容易脱节,导致人名、技术名词前后不一致。Qwen-Audio-3.0-ASR-Flash引入了长音频上下文记忆能力,能够参考前文信息,在长达数小时的会议中保持关键信息的连贯性,彻底解决了“碎片化”问题。
内置行业词典,生僻术语也能懂
医疗、IT等专业领域的术语,对通用语音识别模型来说常常是“拦路虎”。该模型内置了行业专属词典,对医学术语的召回率达到95.36%,对IT编程术语的召回率也有91.87%。这意味着,即使不手动配置,也能准确识别那些晦涩难懂的专业词汇。
热词定制,即改即用
对于企业特有的词汇,用户可以通过分层热词定制功能,让新词立即生效。在大多数场景下,热词召回率超过99%,而且不会因为热词增多而误触发。
语音润色,一步到位
识别结果常常带有“嗯”“啊”等口头禅,或者重复、自我修正的语句。该模型集成了语音润色功能,可以自动去除口头禅、清理重复、处理自我修正,并进行语义重组,输出内容的质量接近“ASR+大模型润色”两步流程的效果。
多语言支持,国际会议无忧
模型支持超过30种语言,在七种语言上的平均语义错误率仅为17.09%,优于Azure、Gemini等业界模型,非常适合国际会议和海外客服场景。
流式版本,实时场景更给力
同步推出的Qwen-Audio-3.0-ASR-Streaming专为实时场景设计,理论字符输出延迟仅300毫秒,中文工业场景字符错误率7.80%,英文11.52%,均处于行业领先水平。该系列此前在Artificial Analysis评测中以1.7%的错误率位居全球第一,目前已广泛应用于会议纪要、实时字幕、教育录音、智能客服等领域。
关键要点
- 长音频记忆:支持数小时会议,保持上下文一致。
- 行业词典:医疗、IT术语召回率超90%。
- 热词定制:即改即用,召回率超99%。
- 语音润色:自动去除口头禅,优化表达。
- 多语言支持:30+语言,国际场景适用。
- 流式版本:延迟300毫秒,适合实时应用。