小米CocktailASR-1:在嘈杂人群中精准识别单一声音的AI
小米CocktailASR-1:在嘈杂人群中精准识别单一声音的AI
想象一下:你身处一个热闹的派对,却不知怎地能专注于一个人的声音,不受笑声和碰杯声干扰。这就是经典的“鸡尾酒会问题”——对人类来说轻而易举,对传统语音识别系统却是噩梦。小米刚刚在解决这一问题上迈出了一大步。
该公司已将CocktailASR-1开源,这是一个工业级的目标说话人语音识别模型。与试图转录所有内容的传统ASR不同,CocktailASR-1利用参考声纹锁定特定说话人。你只需提供一段想要听到的人物的短音频样本,它就能从多人混合音频中识别出他们的词语——过滤掉其他声音、回声和背景噪声。

工作原理
在底层,CocktailASR-1采用端到端大语言模型架构。它将D2V2音频编码器、适配器和大模型解码器串联在一起,全部打包在一个检查点中。使用时,只需将参考音频与目标音频拼接,中间用一秒静音分隔。这种设计使其具有多功能性:无需切换模型即可处理单说话人和复杂的多说话人场景。
性能不言自明
数字令人印象深刻。在模拟多说话人测试中,CocktailASR-1在LibriMix2mix上实现了仅4.11%的词错误率(WER),在LibriSpeechMix2mix上为2.90%。与其他知名模型相比:在LibriMix3mix上,一些竞争对手的WER在76%到121%之间,而CocktailASR-1仅12.29%。这不是改进——这是另一个级别的表现。
真实会议录音?该模型在AMI SDM和AliMeeting Far上也表现出色,超越了现有解决方案。在单说话人设置中,它在LibriSpeech、WenetSpeech和CommonVoice-zh上击败了竞争对手。
两个值得强调的功能
除了准确性,CocktailASR-1还带来两个实用优势。首先,它擅长拒绝负样本。如果参考音频属于当前对话中不存在的人,模型会输出空文本——不会为智能音箱或车载助手误触发。其次,它支持思维链推理:在给出最终答案之前,它可以展示如何识别说话人。这不会大幅提升准确性,但使系统更易于解释和调试。
开源且即用
CocktailASR-1现已在GitHub上以Apache 2.0许可证提供。依赖项极少——只需torch、torchaudio、transformers和soundfile——因此你可以轻松从HuggingFace加载。小米的此举标志着语音技术的转变:从捕获所有声音到锁定一个。
关键要点
- 小米开源CocktailASR-1,一个目标说话人语音识别模型。
- 它使用参考声纹从混合音频中分离出特定说话人。
- 在多个基准测试中达到最先进的WER,远超竞争对手。
- 具有负样本拒绝和思维链推理功能。
- 在GitHub上以Apache 2.0提供,依赖简单。