跳转到主要内容

阿里巴巴新语音识别模型医学词汇准确率达95%

阿里巴巴正式发布了其最新的语音识别模型Qwen-Audio-3.0-ASR-Flash,其明确使命是:帮助AI真正理解各行业的专业语言。该模型在三个关键领域进行了微调——上下文一致性、行业特定词汇识别和热词定制——并且还具备语音润色功能,可以直接输出结构化文本。

Image

该模型的研究团队一直在从医疗保健、IT编程、股票市场和社会媒体名人等不同领域挖掘专业词汇。他们构建了一个涵盖多个领域的综合词汇数据库。在内部评估中,该模型在各行业的“听力准确率”上表现出显著提升,其中医疗场景达到了令人印象深刻的95.36%。

三个版本,五个场景,一个榜首

Qwen-Audio-ASR-Flash系列已在会议记录、实时字幕、教育录制和智能客服等实际应用中证明了其价值。在AI评估平台Artificial Analysis上,它以仅1.7%的错误率夺得全球第一。这清楚表明,AI语音转文字已达到在办公和教育场景中真正实用的可靠性水平。

现在,该模型可通过阿里云百炼平台访问,提供三个版本:Flash版用于最长5分钟的实时识别,Filetrans版用于离线文件转录,Streaming版用于连续实时识别。当AI不仅“听到”而且理解你所在领域的复杂术语时,语音交互的最后一公里或许终于触手可及。

关键要点

  • 医学词汇准确率: 内部测试中达到95.36%。
  • 全球排名: 在Artificial Analysis上以1.7%的错误率位列第一。
  • 三个版本: Flash(实时,最长5分钟)、Filetrans(离线)、Streaming(连续)。
  • 可用平台: 阿里云百炼平台。
  • 目标用例: 会议、字幕、教育、客服。