腾讯新语音识别模型理解语境,而非仅仅识别词语
腾讯混元正式发布了其下一代语音识别模型Hy ASR3.0的预览版。这不仅仅是又一次增量更新——而是一次飞跃。该模型首次将腾讯Hy3大语言模型的深度语义理解与高精度语音识别相结合。结果如何?语音识别不仅转录词语,还能真正理解语境,适应各种场景,并提供直接、有意义的输出。
想想听与聆听之间的区别。传统的语音识别系统就像勤奋的速记员——它们捕捉每个词语,但错过含义。Hy ASR3.0旨在更像一个专注的对话伙伴。它不只是听;它理解。从“逐词转录”到“语境理解”的转变是这款模型的独特之处。
那么,它的表现如何?数字令人印象深刻。在开源评估集上,普通话的词错误率(WER)仅为3.34%,英语为2.62%,粤语为3.12%——总体错误率在3%左右。但真正的考验来自自建评估集,涵盖通用识别、十多种方言、语境语义理解、专业术语以及高噪音和耳语等复杂声学场景。在所有测试中,该模型都保持了行业领先的性能。
内部有什么?奥秘在于全链路优化。架构采用混合专家(MoE)设计,平衡了效率和性能,基础升级为Hy3大模型。一个自研的无监督语音编码器,在数千万小时的语音数据上训练,增强了声学特征提取。在预训练阶段,语音编码器和大型语言模型在涵盖多种方言、口音和声学环境的大规模数据上联合训练。多阶段能力注入增强了方言识别和语境感知等特性。
训练后阶段更有趣。团队构建了一个覆盖20多个方言区域的监督微调(SFT)数据集,并结合多阶段强化学习。这专门解决了复杂场景中的误识别和漏识别问题。这就像给模型上了一堂关于人类实际说话方式的杂乱多变的速成课。

这对日常用户意味着什么?想象一下在嘈杂的咖啡馆里口述消息,或者让语音助手理解带有浓重口音的句子,或者即使人们互相打断也能准确转录会议。Hy ASR3.0旨在优雅地处理这些现实世界的情况。它不仅仅关乎安静房间里的准确性,更关乎日常生活的混乱中的可靠性。
其影响超越了便利性。对于客户服务、医疗保健和法律文档等精确理解至关重要的行业,这项技术可能改变游戏规则。它还可以使语音界面更容易被具有不同语音模式的人使用,打破当前系统经常绊倒的障碍。
当然,这是一个预览版,总有改进空间。但方向是明确的:语音识别正在从机械工具演变为真正理解我们的智能助手。随着腾讯继续完善Hy ASR3.0,我们可以期待更令人印象深刻的能力。语境感知语音识别的时代已经到来,而且只会变得更好。
关键点
- Hy ASR3.0预览版将腾讯Hy3大语言模型与高精度语音识别相结合,实现语境理解。
- 令人印象深刻的准确性:在开源集上,普通话WER为3.34%,英语为2.62%,粤语为3.12%。
- 稳健的性能,涵盖方言、噪音、耳语和专业术语。
- 技术创新:MoE架构、无监督语音编码器、联合预训练和多阶段强化学习。
- 现实世界影响:更好的语音界面,提高可访问性,以及客户服务、医疗保健和法律领域的潜在变革。