跳转到主要内容

OpenAI的GPT-Live-1让你与AI对话不再尴尬停顿

OpenAI的GPT-Live-1让你与AI对话不再尴尬停顿

你是否曾尝试与语音助手对话,却感觉像在对讲机里说话?你说话,它等待,它思考,它回应——而那时,你早已转移了话题。OpenAI想要解决这个问题。

该公司推出了GPT-Live-1,一种在其API中可用的新型全双工语音模型,旨在让AI语音交互感觉不那么像与机器交谈,而更像与人聊天。

为什么传统语音AI感觉笨拙

如今大多数语音代理依赖于级联设置:语音转文本,然后模型推理,再文本转语音。每一步都会增加延迟。结果呢?尴尬的停顿、错过的提示,以及被自己的助手打断的沮丧感。

GPT-Live-1采取了不同的方法。它通过单一模型处理输入和输出音频,简化了整个流程。该模型可以立即处理打断,并悄悄地将繁重的推理和工具调用委托给后端文本模型。即使AI在幕后进行复杂工作,对话也能保持流畅。

它的突出之处

打断处理是GPT-Live-1的亮点。与语言学习平台Speak的早期测试显示,在思考停顿期间,打断减少了近80%。这意味着更少的尴尬沉默和更自然的来回交流。

开发者还可以通过系统提示来塑造代理的语气、节奏和对话风格。该模型能很好地处理背景噪音和静默环境,使其非常适合电话客服、餐厅预订和长篇对话。

在基准测试中,GPT-Live-1与提供中等推理强度的GPT-6 Astra搭配时表现异常出色。

定价与可用性

GPT-Live-1现已在API中全面可用。前端语音层费用为每分钟0.05美元。Yelp和Intercom等行业合作伙伴已报告在轮换准确性方面有显著改善。

一位合作伙伴指出:“AI语音支持终于可以超越那种停停走走的节奏了,”并描述对话感觉就像面对面互动一样自然。

关键要点

  • GPT-Live-1是OpenAI的新型全双工语音模型,现已在API中可用。
  • 它使用单一模型处理输入和输出音频,减少延迟并流畅处理打断。
  • 早期测试显示,在思考停顿期间打断减少了80%
  • 开发者可以自定义语气、节奏和风格;它能很好地处理背景噪音。
  • 定价:前端语音层每分钟0.05美元