腾讯新ASR3.0:AI理解你的口音,而不仅仅是你的话
腾讯刚刚在语音识别领域迈出了一大步,发布了Hy ASR3.0 Preview。这不仅仅是又一次增量更新——它从简单的转录词语转变为真正理解你的意思。新模型基于最新的Hy3大语言模型,结合了高精度语音识别和深度语义理解。目标是什么?让AI不仅能清晰听到每个音节,还能理解你话语背后的意图。
想象一下,用浓重的口音或在嘈杂的房间里口述一条消息,AI仍然能准确理解——不仅仅是逐字逐句,而是结合上下文。这就是Hy ASR3.0的承诺。它旨在处理我们说话时混乱、真实的方式,包括方言、同音词和模糊短语。
方言友好且准确
其突出特点之一是支持十种主要方言区域,包括粤语和吴语,以及二十多个子区域。所以无论你说普通话、英语还是方言,该模型都旨在保持低错误率。根据开源评估数据,多种语言的词错误率(WER)约为3%:普通话3.34%,英语2.62%,粤语3.12%。这接近行业最佳性能。
但准确性不仅仅是匹配声音和词语。模型使用上下文来推断你的真实意图。例如,在会议录音中,如果有人说“我会在银行见你”,AI可以根据周围对话判断是金融机构还是河岸。这种“先理解,后转录”的方法对于长音频(如采访和会议记录)来说是一个游戏规则改变者,传统系统经常在同音词上出错。
背后的技术
那么它是如何工作的?该模型使用专家混合(MoE)架构,平衡了效率和性能。基础升级为Hy3,团队开发了自研的无监督语音编码器。该编码器在数千万小时的无监督语音数据上训练,从复杂音频中提取高质量声学特征。简而言之,编码器负责“听得好”,而Hy3负责“理解正确”。
训练过程涉及语音编码器和大语言模型的联合训练,使用数千万小时的多源语音数据。通过多阶段能力注入,模型获得了上下文感知、复杂场景适应性和方言识别能力。后训练阶段专注于构建高质量的有监督微调(SFT)解决方案,涵盖通用识别、上下文理解和在挑战性环境中的鲁棒性。他们还引入了多阶段强化学习,以持续提高长尾场景的性能。
这对你意味着什么
对于日常用户来说,这可能意味着在口述文本或语音搜索时减少令人沮丧的错别字。对于依赖转录服务的专业人士——记者、医生、律师——准确捕捉带口音的语音并解决歧义的能力可以节省数小时的编辑时间。而且,支持多种方言,这是朝着让语音技术更具包容性迈出的一步。
当然,这是一个预览版本,所以我们还得看看它在实际中的表现。但早期的数字是令人鼓舞的。腾讯显然在推动极限,让AI真正理解人类语音的竞赛正在升温。
关键点
- Hy ASR3.0 Preview 支持10种方言区域和超过20个子区域。
- 词错误率 在普通话、英语和粤语中约为3%。
- 上下文感知 转录解决同音词和歧义。
- MoE架构 基于Hy3和无监督语音编码器。
- 在数千万小时 的多源语音数据上训练。
- 后训练 包括SFT和多阶段强化学习。
