OpenAI全新语音AI可处理你的来电——且不会打断你
OpenAI全新语音AI可处理你的来电——且不会打断你
曾经被困在电话树中,对着虚空大喊“转人工”吗?OpenAI的最新举措可能最终终结这个噩梦。该公司刚刚将GPT-Live-1引入其API,这是一个为开发者带来实时、全双工语音交互的模型。翻译一下:你的AI代理现在可以同时听和说,优雅地处理打断,甚至能应对电话通话中混乱的现实。
告别尴尬的停顿
与传统的对讲机式语音机器人不同,GPT-Live-1将语音理解和输出集成到一个单一模型中。这意味着不再有笨拙的“语音转文本→语言模型→文本转语音”接力赛。结果呢?更低的延迟和感觉上更人性化的对话。它可以处理背景噪音、停顿,以及我们都会有的那些“呃,等等,实际上……”的时刻。
开发者可以通过系统提示调整语气、速度和风格,并将其连接到Codex或OpenAI Presence等后端工具。因此,AI代理可以查询你的CRM、预订餐厅,或将呼叫者转接给人工——所有这些都不会中断对话。

早期成果:更少打断,更少代码
数字令人印象深刻。语言学习平台Speak发现,与旧的轮次系统相比,学习者停顿时被错误打断的情况下降了近80%。医疗服务平台的CTO Tony Stoyanov报告称,他的团队在切换后削减了80%的代码——约23,000行。在OpenAI自己的测试中,GPT-Live-1在全双工基准测试中以30个百分点的优势击败了GPT-Realtime-2.1,并在与GPT-6 Astra配对时,在Tau3端到端语音代理任务中名列前茅。
定价和新语音
担心成本?前端语音层每分钟0.05美元——大约每小时3美元。后端模型和工具单独计费。OpenAI还新增了12种新语音(Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder),并承诺很快支持更多语言。
所以下次你打电话给餐厅时,如果接待员从未听错你的名字,不要惊讶。AI语音革命不是即将到来——它已经在通话中了。
关键要点
- 全双工语音: GPT-Live-1同时听和说,处理打断和背景噪音。
- 电话就绪: 支持客户服务、预订和企业系统查询。
- 更低延迟: 单模型设计省去了传统的多步骤管道。
- 已验证的结果: Speak将错误打断减少了80%;一个团队移除了23,000行代码。
- 定价: 语音层每分钟0.05美元;新增12种语音。