跳转到主要内容

腾讯新ASR模型:听觉与理解融合,错误率降至3%

腾讯混元正式发布了其最新的语音识别模型Hy ASR3.0 Preview。这不仅仅是又一次增量更新——这是机器处理口语方式的根本性转变。该模型超越了传统的“逐字转录”方法,转向更宏大的目标:上下文理解。基于腾讯最新一代大语言模型Hy3构建,它结合了高精度语音识别与深度语义理解。目标是什么?让AI不仅清晰听到每个词,而且真正理解你在说什么。

打破普通话壁垒

Hy ASR3.0 Preview最引人注目的特点之一是其令人印象深刻的语言范围。它不要求标准普通话——支持十大主要方言区,包括粤语和吴语,以及二十多个次级子区域。根据开源评估数据,该模型在多种语言中的词错误率(WER)徘徊在3%左右:普通话3.34%,英语2.62%,粤语3.12%。这些数字接近行业上限,使该模型成为语音识别领域的有力竞争者。

但准确性只是故事的一部分。通过利用Hy3的语言理解能力,该模型可以通过考虑更广泛的上下文来捕获用户意图。它自动消除歧义,并智能纠正同音词——发音相同但含义不同的词。在会议记录或长音频采访等场景中,这种“先理解,后转录”的方法表现出色。传统转录常常在同音混淆上出错,而Hy ASR3.0可以根据语义逻辑选择正确的词,提供有意义的结果。

幕后技术

Hy ASR3.0 Preview的核心使用混合专家(MoE)架构,平衡了效率和性能。基础模型已升级到Hy3,混元团队开发了专有的无监督语音编码器。该编码器在数千万小时的无监督语音数据上训练,从复杂音频中提取高质量的声学表示。简而言之,编码器负责“听清”,而Hy3负责“理解对”。

数据策略同样令人印象深刻。团队对语音编码器和大语言模型进行了联合训练,整合了数千万小时的多源语音数据。通过多阶段能力注入,模型获得上下文感知、复杂场景适应性和方言识别能力。后训练阶段专注于构建高质量的监督微调(SFT)解决方案,涵盖通用识别、上下文理解和复杂环境下的鲁棒性。这包括处理专业术语、不同声学设置和多样化的语音输入。此外,多阶段强化学习方法持续优化复杂长尾场景中的性能。

为何重要

对于日常用户,这项技术可能意味着更准确的语音助手、更好的会议转录工具,以及在嘈杂环境中与AI更流畅的交互。对于企业,它为更可靠的自动客服、高效的采访文档化,甚至跨方言的实时翻译打开了大门。从“听见”到“理解”的转变不仅是技术里程碑——它是迈向更自然、更类人的AI交互的一步。

关键要点

  • Hy ASR3.0 Preview是腾讯混元的新语音识别模型,从转录转向上下文理解。
  • 支持10大方言区和20多个子区域,普通话、英语和粤语的词错误率约为3%。
  • 使用MoE架构和专有的无监督语音编码器,在数千万小时数据上训练。
  • 结合语音识别与大语言模型理解,纠正同音词并捕获意图。
  • 目标应用包括会议记录、长音频采访和复杂声学环境。

Image