小米开源CocktailASR-1:嘈杂环境也能精准识别目标说话人
小米开源CocktailASR-1,破解嘈杂环境下的语音识别难题
想象一下,你身处一个喧闹的派对,周围人声鼎沸,但你却能毫不费力地听清朋友对你说的每一句话。这种人类与生俱来的能力,对传统的自动语音识别(ASR)模型来说,却是一个长期无解的“鸡尾酒会问题”。如今,小米给出了新的答案。
近日,小米正式开源了工业级目标说话人语音识别大模型 CocktailASR-1。它彻底改变了语音识别的传统输入方式,采用基于参考声纹的目标说话人识别机制。简单来说,你只需提供一段目标说话人的参考音频,模型就能利用声纹嵌入精准定位到这个人,在多人混合音频中只转写他的发言,而其他人的声音、混响和背景噪声都会被自动过滤掉。

技术架构:端到端大模型设计
在底层架构上,CocktailASR-1 采用了端到端的大语言模型架构,由 D2V2 音频编码器、Adapter 和大模型解码器串联而成,所有权重都集成在一个检查点中。实际使用时,输入格式是参考音频与目标单声道音频的拼接,中间插入一秒静音作为分隔符。这种设计让模型具备了极高的通用性,无论是单人场景还是复杂的多人场景,都能无缝处理,无需切换模型。
性能表现:多项测试全面领先
多项基准测试验证了该模型的强大能力。在模拟多人对话的测试中,CocktailASR-1 在 LibriMix2mix 和 LibriSpeechMix2mix 数据集上的词错误率(WER)分别降至 4.11% 和 2.90%。相比之下,同领域的一些知名模型在混合场景下表现糟糕,例如在 LibriMix3mix 测试中,部分竞品的 WER 高达 76% 到 121%,而 CocktailASR-1 仅为 12.29%,优势堪称革命性。即便在更具挑战的真实会议录音场景(如 AMI SDM 和 AliMeeting Far)中,它也显著超越了现有方案。而在单人场景下,它在 LibriSpeech、WenetSpeech 和 CommonVoice-zh 等数据集上同样全面胜出。
实用特性:负样本拒绝与思维链推理
除了识别准确率的突破,CocktailASR-1 在工程实现和实用性上还有两个亮点。首先,它具备强大的负样本拒绝能力。当参考音频对应的人并未参与当前对话时,模型会直接输出空文本,有效防止智能音箱、车载语音助手等设备被他人声音误触发。测试表明,其负样本拒绝率在多个数据集上表现优异。其次,模型支持思维链推理功能,在输出最终答案前,可以通过特定标签展示其识别说话人的过程。虽然这对准确率影响微乎其微,却大大增强了系统的可解释性和调试便利性。
目前,CocktailASR-1 的相关代码已在 GitHub 上以 Apache 2.0 许可证正式开源,依赖环境极其简单,只需 torch、torchaudio、transformers 和 soundfile 等基础库,即可从 HuggingFace 轻松加载部署。小米在语音技术底层逻辑上的这次转变,标志着语音识别正从传统的“捕捉所有声音”迈入“锁定一个声音”的新发展阶段。
Key Points
- 精准识别:基于参考声纹,从多人混合音频中只转写目标说话人的语音。
- 性能卓越:在 LibriMix3mix 测试中 WER 仅 12.29%,远低于竞品的 76%-121%。
- 实用功能:支持负样本拒绝,防止误触发;支持思维链推理,提升可解释性。
- 开源易用:Apache 2.0 许可,依赖简单,可从 HuggingFace 直接加载。