跳转到主要内容

阿里巴巴新语音AI以95%准确率攻克医学术语

阿里巴巴已正式推出其最新的语音识别模型Qwen-Audio-3.0-ASR-Flash,它不仅用于转录文字,更在于理解那些常常让AI出错的复杂专业词汇。该模型在三个关键领域进行了微调:保持上下文一致、识别行业特定术语、以及允许用户自定义热词。它甚至优化了语音输出,直接提供结构化文本。

Image

该项目团队深入研究了医疗、IT、金融甚至名人八卦等领域,构建了丰富的专业术语数据库。在内部测试中,该模型对行业术语的“听力准确率”显著提升,医疗场景达到了惊人的95.36%。

三个版本,五个场景,全球第一

Qwen-Audio-ASR-Flash系列已在现实应用中证明了其价值——例如会议记录、实时字幕、教育录音和客户服务。它此前在AI评估平台Artificial Analysis上夺得第一,错误率仅为1.7%。这意味着办公和课堂场景中的AI转录已达到真正可用的水平。

现在,您可以通过阿里云的百炼平台访问该模型。有三个版本可供选择:Flash用于实时识别最长5分钟的音频,Filetrans用于离线文件转录,Streaming用于连续实时识别。当AI不仅“听到”而且真正理解您所在行业的复杂术语时,语音交互的最后一公里可能终于触手可及。

要点

  • Qwen-Audio-3.0-ASR-Flash专注于理解跨行业的专业词汇。
  • 医学术语准确率达到95.36%,全球最低错误率1.7%。
  • 在阿里云上提供三个版本,覆盖实时和离线转录需求。