跳转到主要内容

阿里云新语音识别模型应对长会议和行业术语

7月31日,阿里巴巴通义千问团队发布了其最新的语音识别模型Qwen-Audio-3.0-ASR,现已在阿里云百炼平台上可用。该模型旨在解决语音识别中的两个长期难题:在长录音中保持上下文跟踪,以及识别小众行业术语而无需用户训练系统。

对于任何曾在两小时的会议中因转录工具丢失线索或弄错医学术语而苦恼的人来说,这一更新可能是个好消息。新模型带来了几项关键升级,直接针对这些痛点。

长音频,不丢失上下文

其突出特点之一是能够在数小时的音频中记住上下文。该模型不是孤立地处理每个片段,而是引用对话的早期部分,确保姓名和技术概念在整个过程中保持一致。这消除了令人沮丧的“碎片化”问题,即说话者的名字在转录中途改变或术语被反复听错。

内置行业词典

另一个重大改进是包含行业特定词典。该模型在医学术语上的召回率达到95.36%,在IT编程术语上达到91.87%。这意味着它可以准确识别诸如“pneumonoultramicroscopicsilicovolcanoconiosis”或“异步JavaScript”等生僻词,无需任何手动配置。对于专业领域的企业来说,这可以节省无数小时的编辑时间。

可定制热词

对于企业用户,该模型提供分层的热词定制。公司特定词汇立即生效,在大多数场景下,召回率超过99%。重要的是,添加更多热词不会导致误触发,这是其他系统常见的问题。

内置语音润色

该模型还集成了语音润色功能,可以清理填充词、去除重复、处理自我修正,并在语义上重新组织句子。据说输出几乎与使用ASR后接大语言模型进行润色的两步过程一样可读。这对于依赖干净转录的内容创作者和记者来说可能是一大福音。

多语言支持

该模型覆盖超过30种语言,整体表现强劲。在测试中,它在七种语言上的平均语义错误率为17.09%,优于Azure和Gemini等行业模型。这使其适用于国际会议和海外客户服务场景。

实时流式版本

除了主模型外,阿里巴巴还发布了Qwen-Audio-3.0-ASR-Streaming,专为实时应用设计。它提供理论字符输出延迟仅为300毫秒,在中文工业场景中的字符错误率为7.80%,英文为11.52%。据该公司称,这些数字领先行业。

Qwen-Audio系列此前在Artificial Analysis评估中以1.7%的错误率全球排名第一。它已被用于会议纪要、实时字幕、教育录音和智能客服等领域。

凭借这些增强功能,阿里巴巴正将自己定位为语音识别领域的强劲竞争者,特别是在专业和企业用例方面。无论你是口述笔记的医生、录制代码审查的开发者,还是转录采访的记者,这个模型都可能让你的生活更轻松一点。

关键要点

  • 长音频上下文记忆:在数小时的音频中保持一致性,避免碎片化。
  • 行业特定词典:医学(95.36%)和IT(91.87%)术语的高召回率。
  • 分层热词定制:在大多数场景下立即生效,召回率超过99%,无误触发。
  • 集成语音润色:清理填充词和重复,产生可读内容。
  • 多语言支持:超过30种语言,在语义错误率上优于Azure和Gemini。
  • 流式版本:300毫秒延迟,中英文错误率领先。