OpenAI新语音API:每分钟仅5美分,像真人一样聊天
OpenAI开放GPT-Live-1 API:每分钟5美分实现类人语音AI
曾希望你的应用能像ChatGPT一样聊天吗?OpenAI刚刚让这件事变得容易多了。该公司已通过API正式向开发者发布GPT-Live-1,这是驱动ChatGPT语音模式的同款语音模型。前端语音处理每分钟0.05美元,你现在就可以构建实时听和说的全双工语音助手。复杂推理?由单独的后端模型处理,按其自身费率计费。

同时听和说
传统语音AI分三步工作:语音识别、语言模型推理和语音合成。系统等你说完才开始思考。GPT-Live-1颠覆了这一模式。它基于全双工架构构建,意味着它可以在仍在聆听的同时生成语音输出。这使得对话感觉更加自然——它能处理打断、停顿和快速来回交流,而不会错过任何节拍。它甚至知道何时继续说话、暂停、聆听或调用工具。
OpenAI表示,这种设计显著降低了延迟,并消除了传统流水线中常见的尴尬连接卡顿。开发者不再需要自己管理多个模型。在测试中,GPT-Live-1在Full Duplex Bench上比GPT-Realtime-2.1高出30个百分点,在轮次转换延迟和交互行为方面有大幅提升。与中等推理强度的GPT-6 Astra搭配使用时,它还在端到端语音代理任务的Tau3测试中名列前茅。
复杂推理?交给后端处理
GPT-Live-1并不承担所有繁重工作。OpenAI将负责实时听和说的语音模型与处理深度推理的后端模型分开。当你提出需要搜索、复杂分析或较长任务的问题时,GPT-Live-1会将工作传递给后端,同时保持语音对话流畅进行。这意味着开发者可以为任务选择合适的后端:简单任务使用更快、更便宜的模型,难题使用更强的推理器。
在实践中,GPT-Live-1原生支持电话场景,非常适合餐厅预订或客户支持等全双工语音代理。早期采用者Speak,一个语言学习平台,发现与之前基于轮次的系统相比,GPT-Live-1将系统对学习者的主动打断减少了近80%。该模型还提供原生语音识别转录和响应文本,支持关键词偏置和轮次检测,并针对嘈杂环境进行了优化。OpenAI扩展了可用语音,以覆盖更多口音、方言和语言。你甚至可以将GPT-Live-1与Codex等工具结合使用——语音模型接受任务,后端处理任务,语音对话随即继续。
要点
- GPT-Live-1 API现已向开发者开放,前端语音处理每分钟0.05美元。
- 全双工架构让模型同时听和说,自然处理打断和停顿。
- 在Full Duplex Bench上比GPT-Realtime-2.1提升30个百分点。
- 复杂推理被卸载到单独的后端模型,允许灵活选择成本和性能。
- 早期合作伙伴Speak在语言学习中系统打断减少了80%。
- 支持电话场景、嘈杂环境、多种口音,并与Codex等工具集成。