跳转到主要内容

谷歌 Gemini 3.5 Transcribe:即使在人群中也能实现水晶般清晰的语音识别

你是否曾尝试在熙熙攘攘的咖啡馆里口述一条消息,结果手机把“我们在公园见”变成了“我们吃鲨鱼吧”?我们都经历过。但谷歌最新的 AI 模型可能终结这些令人沮丧的时刻。

谷歌正式推出了 Gemini 3.5 Transcribe,这是 Gemini 系列的最新成员,被誉为公司有史以来最准确的语音识别模型。该模型现已向开发者、企业和公众开放,承诺解决背景噪音、专业术语以及我们实际说话时杂乱自然的方式等长期挑战。

Gemini 3.5 Transcribe 的突出之处是什么?

从核心来看,该模型旨在理解你,而不仅仅是听到你。它能以惊人的精度过滤背景噪音,但不止于此。它还能轻松处理医学、法律或技术等领域的复杂词汇。想象一下,口述一句充满“光合作用”或“量子纠缠”等术语的句子,结果完美输出——无需手动更正。

对于开发者来说,这开启了一个充满可能性的世界。你现在可以构建语音代理、实时字幕工具,甚至通话后分析工作流,这些在现实条件下都能正常工作。该模型的稳健性能意味着更少的错误和更满意的用户。

专为人类对话设计

Gemini 3.5 Transcribe 最令人印象深刻的一点是它如何处理人类语音的怪癖。它捕捉说话者的自然意图,识别自定义词汇,甚至过滤掉“嗯”和“啊”等尴尬的填充词。你知道的,那些我们都会不假思索使用的词。输出干净、格式化,随时可用。

但关键在于:该模型还可以将更复杂的任务委托给其他 Gemini 模型。需要分析文件或生成图像?只需提出要求,它就会无缝交接。这种多模型协作给用户带来了几乎神奇的全方位体验。

令人印象深刻的准确率数字

让我们谈谈数字,因为它们相当令人印象深刻。谷歌报告称,Gemini 3.5 Transcribe 在流式语音识别中的平均词错误率(WER)仅为 4.0%,在非流式场景中降至惊人的 2.6%。即使在嘈杂环境中,它也保持高稳定性,并且在处理订单号、邮政编码等关键字母数字信息时特别准确。所以,在关键时刻,再也不会把“B”误认为“D”了。

多语言和个性化

在当今全球化的世界中,语言支持是关键。该模型支持 85 种语言,并能轻松适应地区口音和方言。对于预处理音频,它甚至可以识别最多三位说话者并带有时间戳——非常适合会议或采访。此外,你可以定义自定义词汇表来处理行业特定术语、特殊拼写或独特名称。这就像有一个永远不会忘记如何拼写客户名字的私人助理。

在哪里可以试用?

如果你渴望尝试,开发者可以通过 Google AI Studio 和 Google Antigravity 中的 Gemini API 预览 Gemini 3.5 Transcribe。对于日常用户,它已集成到 macOS 上的 Gemini 应用和 Android 上 Gboard 的 Rambler 功能中。如果这还不够,谷歌计划很快将其引入 Chrome 浏览器,让你可以直接在任何网页表单中口述。想象一下,用你的声音输入这篇文章——无需键盘。

此次发布是谷歌更广泛推动 AI 融入我们数字生活每个角落的一部分。随着最近 Gemini 3.7 Flash 的发布以及助手集成到 Waymo 的自动驾驶出租车中,很明显谷歌正在快速行动,使 AI 成为我们日常生活的无缝部分。

关键要点

  • Gemini 3.5 Transcribe 是谷歌最准确的语音转文本模型,专为嘈杂环境和复杂词汇设计。
  • WER 在非流式模式下低至 2.6%,在流式和嘈杂设置中表现强劲。
  • 支持 85 种语言,可识别最多三位说话者,并支持自定义词汇表。
  • 现已通过 API 提供给开发者,并面向 Android 和 macOS 用户,Chrome 集成即将推出。
  • 是谷歌更广泛 AI 生态系统的一部分,包括 Gemini 3.7 Flash 和 Waymo 集成。

Image

所以,无论你是正在构建下一个大型语音应用的开发者,还是厌倦了听错文本的普通用户,Gemini 3.5 Transcribe 都值得一试。它可能会改变你与设备对话的方式。