OpenAI 新语音 API 让开发者以每分钟 5 美分构建实时对话应用
OpenAI 新语音 API 让开发者以每分钟 5 美分构建实时对话应用
OpenAI 悄然迈出了一大步:驱动 ChatGPT 语音对话的同款语音模型现已通过 API 向开发者开放。该模型名为 GPT-Live-1,让你能够构建可以同时收听和响应的语音助手——无需再等待用户说完,AI 才能插话。
价格呢?前端语音处理每分钟 5 美分。这是处理实时收听和说话的部分。如果你的应用需要繁重的推理,则根据你选择的后端模型单独计费。

同时收听和说话
当今大多数语音 AI 的工作方式像对讲机:你说,它等,然后它说。这意味着尴尬的停顿、错过的打断和生硬的节奏。GPT-Live-1 颠覆了这一点。它采用全双工架构,意味着它可以在收听你的同时生成语音。因此它能处理打断、停顿、快速来回对话,甚至知道何时继续说话、停止或调用工具。
OpenAI 表示,这大幅降低了延迟,并消除了独立语音识别、语言和合成模型之间笨拙的交接。在测试中,GPT-Live-1 在 Full Duplex Bench 上以30 个百分点的优势击败了之前的 GPT-Realtime-2.1,尤其是在轮流发言和交互行为方面。当与中等推理能力的 GPT-6 Astra 配对时,它还在端到端语音代理任务的 Tau3 基准测试中名列前茅。
复杂思考由单独的大脑处理
并非每个问题都需要深入探讨。GPT-Live-1 将工作分开:它处理实时语音交互,但当你提出需要搜索、分析或更长任务的问题时,它会移交给后端模型。这样,开发者可以为任务选择合适的大脑——简单内容用快速、便宜的模型,困难内容用更强的推理器。
这也意味着你只需为使用的内容付费。每分钟 5 美分涵盖语音前端;后端推理按你选择的模型计费。
实际应用,从预订到语言学习
GPT-Live-1 原生支持电话场景,因此已准备好用于餐厅预订或客户支持等全双工语音代理。早期测试很有前景:语言学习平台 Speak 发现,与之前基于轮次的系统相比,GPT-Live-1 将系统对学习者的打断减少了近 80%。
该模型还提供原生语音识别转录和响应文本,支持关键词偏置和轮次检测,并针对嘈杂环境进行了优化。OpenAI 扩展了可用语音,以覆盖更多口音、方言和语言。开发者可以将 GPT-Live-1 与 Codex 等工具结合——语音模型接收请求,后端工具处理它,然后语音对话继续。
这是一个相当明确的信号:OpenAI 希望开发者构建语音优先的应用,让它们感觉不像与机器交谈,而更像与人交谈。而且每分钟 5 美分,尝试的成本突然低了很多。
要点:
- GPT-Live-1 API 现已向开发者开放,前端语音处理定价为每分钟 0.05 美元。
- 全双工架构允许同时收听和说话,自然处理打断。
- 复杂推理被卸载到单独的后端模型,按使用量计费。
- 像 Speak 这样的早期采用者发现系统打断减少了 80%。
- 支持电话场景、多种口音,并与 Codex 等工具集成。