跳转到主要内容

阿里云新语音识别模型攻克行业术语与长会议难题

7月31日,阿里巴巴通义千问团队正式发布了Qwen-Audio-3.0-ASR,这是一款语音识别大模型,承诺能够处理长音频而不丢失词语,并且无需额外训练即可识别行业特定术语。该模型现已在阿里云百炼平台上可用。

这次发布有何特别之处?让我们分解五个关键升级,它们解决了语音识别中一些最令人沮丧的痛点。

长音频上下文记忆

你是否曾尝试转录三个小时的会议,却发现AI忘记了第一个小时的内容?有了这个模型,那已成为过去。它可以参考之前的上下文,在整个会议期间保持名称和技术概念的一致性。不再有跳跃且不连贯的“碎片化”转录。

内置行业词典

专业人士最大的头疼问题之一是让AI识别晦涩的行话。Qwen-Audio-3.0-ASR预装了各种行业的词典。例如,它在医学术语上的召回率达到95.36%,在IT编程术语上达到91.87%。这意味着你无需手动配置任何东西——只需开始说话,模型就能正确识别。

分层热词定制

对于企业特定的词汇,该模型允许你添加自定义热词,这些热词会立即生效。在大多数场景中,这实现了超过99%的召回率。而且关键在于:即使你添加了大量热词,也不会触发误报。因此,你可以放心定制,而不用担心模型出错。

集成语音润色

我们都见过转录文本中充斥着“嗯”、“啊”和重复的短语。这个模型一次性清理所有这些。它去除填充词,处理重复和自我纠正,甚至按语义重新组织内容。结果如何?转录文本读起来几乎像经过人工编辑使用两步“ASR + 大模型”方法润色过一样流畅。

多语言支持

在我们全球化的世界中,会议经常跨越多种语言。这个单一模型支持超过30种语言,在七种关键语言上的平均语义错误率仅为17.09%。这优于Azure和Gemini等行业巨头,使其成为国际会议和海外客户服务的理想选择。

但等等,还有更多。除了Flash版本,阿里巴巴还推出了Qwen-Audio-3.0-ASR-Streaming,专为实时场景设计。它声称理论字符输出延迟仅为300毫秒,在工业环境中,中文的字符错误率为7.80%,英文为11.52%——均领先行业。

该系列已在全球引起轰动,在Artificial Analysis评估中以1.7%的错误率排名第一。它被广泛应用于从会议记录、实时字幕到教育录音和智能客服的各种场景。

所以,无论你是口述患者笔记的医生、解释代码的开发者,还是协调国际团队的项目经理,这个新模型都可能成为最终让语音识别为你所用的工具。

关键要点

  • 长音频上下文记忆确保数小时会议中的一致性。
  • 内置行业词典在医疗和IT术语上实现高召回率。
  • 自定义热词提供超过99%的召回率且无误触发。
  • 集成语音润色自动清理转录文本。
  • 多语言支持覆盖30多种语言,优于Azure和Gemini。
  • 流式版本为实时应用提供超低延迟。