跳转到主要内容

阿里云新语音识别模型攻克专业术语难题

7月31日,阿里巴巴通义千问团队正式发布了其最新的语音识别模型Qwen-Audio-3.0-ASR。这款新模型旨在解决语音识别中两个长期存在的难题:在长录音中保持上下文连贯,以及无需用户自行训练词汇表即可正确识别专业术语。该模型现已上线阿里云百炼平台,供开发者和企业试用。

五大关键升级

该模型带来了五项重大改进,使其区别于前代产品。

1. 长音频上下文记忆

在转录长达数小时的会议时,最大的挑战之一是模型可能会丢失先前的内容,导致名称或技术术语不一致。Qwen-Audio-3.0-ASR通过在转录过程中引用先前的上下文来解决这一问题。这意味着如果有人在会议早期提到一个项目名称,模型将在后续继续使用该名称,避免了音频不同部分看似脱节的“碎片化”问题。

2. 内置行业词典

手动添加每个生僻术语的日子一去不复返。该模型为特定领域预装了词典。对于医学术语,其召回率达到95.36%;对于IT编程,召回率达到91.87%。这意味着无需任何额外设置即可准确识别复杂、小众的词汇——这对于这些行业的专业人士来说非常节省时间。

3. 分级热词定制

对于拥有自己独特词汇的企业,该模型支持热词定制。这些企业特定术语可立即生效,在大多数场景下召回率超过99%。重要的是,添加更多热词不会引发误报,因此您不必担心因为添加了大量自定义术语而导致模型误听常见词汇。

4. 集成语音润色

转录结果往往杂乱无章,充满“嗯”、“啊”等填充词、重复和自我修正。该模型一次性清理所有这些内容。它去除填充词,整理重复,处理自我修正,甚至对内容进行语义重组。结果是润色后的转录文本,几乎与您通过单独的大语言模型进行编辑的效果一样好——但无需额外步骤。

5. 多语言支持

该模型覆盖30多种语言,专为国际使用而设计。在测试中,它在七种语言中的平均语义错误率为17.09%,优于Azure和Gemini等行业竞争对手。这使其成为国际会议和海外客服场景的可靠选择。

实时流式版本

除了主模型外,阿里巴巴还推出了Qwen-Audio-3.0-ASR-Streaming,专为实时应用设计。其理论字符输出延迟仅为300毫秒,几乎即时。在中国工业场景中,其字符错误率为7.80%,英语为11.52%——均处于行业领先水平。该系列此前在Artificial Analysis评估中以1.7%的错误率全球排名第一,并已应用于会议纪要、实时字幕、教育录音和智能客服等领域。

关键要点

  • 长音频上下文记忆确保数小时内容的转录一致性。
  • 内置词典覆盖医学和IT领域,无需手动配置即可实现高召回率。
  • 热词定制在大多数场景下召回率超过99%,且无误触发。
  • 集成语音润色一步完成转录清理,媲美两步式ASR+LLM方法。
  • 多语言支持覆盖30多种语言,语义错误率优于Azure和Gemini。
  • 实时流式版本提供300毫秒延迟和行业领先的错误率。

凭借这些能力,Qwen-Audio-3.0-ASR有望使专业转录更加准确高效,为各行业用户节省时间并减少困扰。