跳转到主要内容

OpenAI 的 GPT-Live-1:边说话边倾听的语音 AI

OpenAI 的 GPT-Live-1:边说话边倾听的语音 AI

使用语音 AI 时,是否感觉像在对着对讲机说话?你说完,等待提示音,然后得到回复。这种停顿与启动的节奏可能很快就会成为过去。OpenAI 刚刚推出了 GPT-Live-1,一个全双工语音模型,能同时处理输入和输出音频——不再有尴尬的停顿。

为什么传统语音 AI 感觉笨拙

如今大多数语音助手依赖级联流程:语音转文本,然后语言模型推理,然后文本转语音。每一步都会增加延迟,结果感觉像接力赛而非对话。更糟的是,当你停下来思考、打断或中途改变话题时,这些系统会挣扎。GPT-Live-1 通过在单一模型中处理双向音频绕过了这一切。这有点像从对讲机升级到电话通话——只不过另一边是一个边说话边倾听的 AI。

GPT-Live-1 的不同之处

有效的打断处理。 与语言学习平台 Speak 的早期测试显示,思考停顿时打断减少了近 80%。换句话说,当你只是在整理思绪时,AI 不再插话。

可定制个性。 开发者可以使用系统提示调整代理的语气、节奏和对话风格。想要一个语速快的预订机器人还是耐心的客服代表?只需调整提示。

背景噪音?没问题。 该模型能优雅地处理嘈杂环境和安静环境,使其适用于电话客服、餐厅预订和漫长闲聊。

无缝交接。 当查询需要深度推理或工具调用时,GPT-Live-1 会委托给后端文本模型而不中断对话流。聊天在后台继续,而语音层保持流畅。

基准测试与可用性

在基准测试中,GPT-Live-1 与 GPT-6 Astra(一个具有中等推理强度的模型)配对时表现异常出色。这种组合在速度和智能之间取得了平衡。

该模型现已在 OpenAI 的 API 中完全可用,前端语音层定价为每分钟 0.05 美元。Yelp 和 Intercom 等合作伙伴已经报告轮次转换准确性显著提高。据他们称,AI 语音支持终于超越了机械的停顿与启动节奏——更接近自然的面对面交谈。

这对开发者意味着什么

如果你正在构建语音代理,GPT-Live-1 提供了更简单的架构和更像人类的体验。不再需要拼接单独的语音转文本和文本转语音服务。不再有用户因为机器人无法处理简单打断而沮丧挂断。全双工语音 AI 的时代已经到来,它已为你的下一个项目做好准备。

关键要点

  • 全双工处理: GPT-Live-1 在单一模型中处理输入和输出音频,消除级联延迟。
  • 友好打断: 早期测试显示思考停顿时打断减少了 80%。
  • 可定制: 开发者可以通过系统提示调整语气、节奏和风格。
  • 嘈杂环境中稳健: 适用于电话客服、预订和长时间对话。
  • 现已可用: OpenAI API 中定价为每分钟 0.05 美元;Yelp 和 Intercom 等合作伙伴报告轮次转换更流畅。