Gemini 3.8 Live:边说话边思考的语音AI
谷歌最新语音模型能在句子中间多任务处理
想象一下,与一个语音助手聊天,它不会让你在搜索网页或运行任务时等待。这就是 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 背后的宣传,这是谷歌刚刚推出的两个新模型。它们旨在保持对话流畅——没有尴尬的停顿,没有“等等,我在思考”。

它们有何不同?
主要特点:后台工具和 API 调用。当你说话时,AI 可以悄悄发起网络搜索、检查数据库或触发操作。你不必在句子中间停下来。这些模型还能自动检测 97 种语言,并能即时切换。需要视觉定位?它们也能处理,并且会通过“让我查一下……”这样的小口头提示让你知道正在发生事情。
它们表现如何?
基准测试还处于早期,但前景看好。Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音到语音质量指数上得分 82.6。在 Speech Agent Arena 中,标准 Live 模型获得第二名。Extended Thinking 版本在 T-Voice 测试中达到 68.6%,在 Sierra T-Voice 基准测试中达到 35.1%,在 Big Bench Audio 上高达 97.7%。
为开发者打造,为现实生活调校
谷歌并未将此独享。该公司已与 Agora、LiveKit、Vercel、Pipecat、Fishjam 和 Vision Agents 等平台合作,使集成更顺畅。你会在 Gemini API 和 Google AI Studio 上看到这些模型推出,并应用于 Search Live、Gemini Enterprise、Google Workspace 和 Gemini Live。
担心 AI 生成的音频被用于恶作剧?谷歌已经考虑到了。这些模型生成的每个片段都带有不可见的 SynthID 水印,因此你可以分辨什么是真实的,什么是合成的。
更大的图景
此次升级将语音 AI 推向了简单的听和说之外。它正朝着持续、多任务的代理发展,这些代理能够理解、推理并完成任务——所有这些都不会打断对话流程。换句话说,等待数字助手跟上来的日子可能终于要结束了。
要点
- Gemini 3.8 Live 和 Live Extended Thinking 支持近乎实时的推理、同步语音和思考,以及后台工具/API 调用。
- 模型支持 97 种语言,具有自动检测和对话中切换功能。
- 基准测试亮点: 语音到语音质量指数 82.6,Big Bench Audio 97.7%,Speech Agent Arena 第二名。
- 与 Agora、LiveKit、Vercel、Pipecat、Fishjam 和 Vision Agents 的开发者集成。
- 所有生成的音频都包含不可见的 SynthID 水印以确保真实性。