阿里新语音AI攻克医学术语,创全球纪录
阿里巴巴刚刚发布了一款引起轰动的全新语音识别模型——它不仅仅是为了理解日常对话。该公司最新发布的Qwen-Audio-3.0-ASR-Flash旨在解决语音AI最大的痛点之一:专业术语。无论是医生口述复杂的医学术语,还是程序员谈论晦涩的编码库,该模型都旨在像专业人士一样聆听。
核心思想简单但雄心勃勃。该模型不仅仅是转录音词,而是经过微调,能够识别并准确处理行业特定词汇。其团队从医疗、IT、金融甚至名人新闻等领域挖掘专业术语,构建了一个覆盖多个行业的丰富数据库。在内部测试中,该模型在“聆听准确率”方面表现出显著提升,医疗场景准确率高达95.36%。
但这还不是全部。该模型还具备语音润色功能,可以直接输出结构化、干净的文本——不再需要大量编辑的杂乱无章的转录文本。
三个版本,五种场景,一个榜首
Qwen-Audio-ASR-Flash系列已在真实场景中得到验证。从会议记录到实时字幕、教育录音和智能客服,它都经过了考验。结果不言自明:在AI评估平台Artificial Analysis上,它以仅1.7%的错误率夺得全球第一。这是办公和教育环境准确性的新基准。
这对你意味着什么?想象一个不会在你所在行业的行话上卡壳的语音助手。无论你是口述案件笔记的律师,还是录制讲座的老师,该模型都可能成为最终让语音AI真正有用的桥梁。
获取方式
该模型现已在阿里云百炼平台上线,提供三个版本。Flash版本支持长达5分钟的实时语音识别,非常适合快速交互。Filetrans版本专为离线文件转录而设计,非常适合处理录制的会议或讲座。对于需要连续实时识别的用户,Streaming版本可以满足需求。
那么,这是语音交互的最后一公里吗?随着AI不仅能“听到”,还能真正理解你所在领域重要的复杂术语,这或许就是。语音技术的未来正变得更加专业化——也更加人性化。
关键要点
- 医学术语准确率达到95.36%,其他行业也有显著提升。
- 全球排名第一,在Artificial Analysis上错误率为1.7%。
- 提供三个版本:Flash(实时,最长5分钟)、Filetrans(离线)和Streaming(连续)。
- 现已在阿里云百炼平台上线。
- 语音润色功能直接输出结构化文本,减少后期处理。