跳转到主要内容

阿里巴巴新语音识别模型在医学术语上达到95%准确率

阿里巴巴正式发布了其最新的语音识别模型Qwen-Audio-3.0-ASR-Flash,其明确使命是:帮助AI真正理解各行业的专业语言。该模型旨在解决语音技术中最大的挑战之一——准确识别和解释经常让标准语音识别系统出错的专业术语。

Image

该模型背后的研究团队一直在从医疗保健、IT编程、股票市场甚至社交媒体名人姓名等不同领域挖掘词汇。他们建立了一个全面的行业特定术语数据库,结果令人印象深刻。在内部评估中,该模型在医学术语上达到了95.36%的准确率——这是一个显著的飞跃。

但这对于日常用户意味着什么?想象一下,口述一份医疗报告或技术文档,而不必纠正每一个词。这就是这个新模型的承诺。它不仅仅是识别单词,更是理解上下文和细微差别,这对于精度至关重要的行业来说至关重要。

Qwen-Audio-ASR-Flash系列已在会议记录、实时字幕、教育录音和智能客服等实际场景中证明了其价值。事实上,它在AI评估平台Artificial Analysis上已获得全球第一的位置,错误率仅为1.7%。这是一项了不起的成就,表明AI语音转文字已达到在专业环境中真正可用的可靠性水平。

现在,该模型可通过阿里云百炼平台获取,提供三个版本以满足不同需求:Flash版本用于实时识别最长5分钟的音频,Filetrans版本用于离线文件转录,Streaming版本用于连续实时识别。无论您是医生、程序员还是内容创作者,总有一个版本适合您的工作流程。

这一发展对语音交互来说是一个游戏规则改变者。当AI不仅能“听到”而且能理解您所在领域的复杂术语时,无缝语音通信的最后一英里可能终于触手可及。所以,如果您曾经因为语音识别在技术术语上出错而感到沮丧,这可能是您一直在等待的突破。

关键要点

  • 医学术语准确率:95.36%,在专业术语识别方面有显著提升。
  • 全球排名:在Artificial Analysis上排名第一,错误率为1.7%。
  • 三个版本:Flash(实时,最长5分钟)、Filetrans(离线转录)和Streaming(连续实时)。
  • 行业重点:针对医疗保健、IT、金融等领域进行了优化。
  • 可用性:现在可通过阿里云百炼平台访问。