跳转到主要内容

Meta新AI模型可同时转录20位说话者,每1000分钟仅需3美元

Meta刚刚发布了其首个实时音频感知模型,对于任何曾经在快节奏对话或混乱会议中难以跟上的人来说,这都是一款改变游戏规则的产品。认识一下Muse Voice Transcribe,这款模型可以实时转录语音,区分多达20位说话者,甚至能理解某人停顿或停止说话的情况。最棒的是?它的价格出奇地实惠,每1000分钟音频仅需3美元——大约每小时0.18美元。

说话即打字——自动区分20多位说话者

想象一下,你正在参加一个十几人的会议,大家都在互相交谈。传统的转录工具会给你一团乱麻。但Muse Voice Transcribe不同。它使用流式自动语音识别,这意味着它会在人们说话时进行转录,而不是事后转录。不再需要等待录音结束才能获得文本。相反,你可以获得实时的、逐段的输出,非常适合实时字幕、会议记录,甚至电话转录。

真正令人印象深刻的是它区分说话者的能力。即使有超过20人在说话,该模型也能分辨出谁是谁。它还能检测到说话者何时停止,自动标记其发言的结束。这对于群体场景中的转录准确性来说是一个巨大的飞跃。

在语言方面,Muse Voice Transcribe是个多语言专家。它支持超过70种语言,其中25种在发布时已验证。它可以处理超过一小时的音频,甚至可以在句子中间或句子之间切换语言——无需重新开始或重新配置。开发者还可以通过使用语言、关键词和上下文偏置来针对特定术语或场景微调识别。

自适应延迟:平衡速度与准确性的秘诀

你可能会想:它是如何做到既快又准的?答案在于一个巧妙的机制,称为“自适应延迟”。系统不是进行一刀切的权衡,而是为每个单词决定在输出结果之前需要多少额外的音频。对于清晰、易于识别的语音,它几乎立即输出转录。但对于含糊不清、充满技术术语或处于复杂上下文的单词,它会等待更长时间,收集更多上下文以确保准确性。这就像一个人性化的听众,在事情清晰时快速点头,但在有歧义时会凑近并请求澄清。

据Meta称,截至2026年9月1日,Muse Voice Transcribe已经在Artificial Analysis流式语音转文字排行榜上占据首位。这是对其能力的强力背书。

这对开发者和用户意味着什么

对于开发者来说,这开启了一个充满可能性的世界。实时转录可以为网络研讨会提供实时字幕,协助客服电话,甚至帮助记者即时转录采访。定价具有竞争力,使初创公司和小型企业也能负担得起。而且凭借处理多说话者和多语言的能力,它是全球团队的通用工具。

但这不仅仅是技术规格。这个模型感觉像是朝着更自然的人机交互迈出的一步。你不是在和一个等你说完的机器说话,而是在进行一场机器能跟上你的对话。这就像拥有一个超级高效的助手,永远不会错过一个字。

关键要点

  • 实时转录:说话时流式输出文本,减少延迟。
  • 说话者分离:处理多达20多位说话者,识别谁说了什么。
  • 语言支持:超过70种语言,其中25种在发布时已验证。
  • 自适应延迟:动态平衡速度和准确性。
  • 价格实惠:每1000分钟音频3美元。
  • 排名第一:在Artificial Analysis流式语音转文字排行榜上位列第一。

Image

Image

Muse Voice Transcribe不仅仅是一个新模型——它让我们一窥未来,机器能够实时倾听和理解,使我们的交互更加顺畅和高效。无论你是希望集成尖端语音识别的开发者,还是厌倦了混乱会议记录的商务人士,这都可能正是你一直在等待的工具。