跳转到主要内容

OpenAI新转录模型超越Whisper

OpenAI发布了两个新的转录模型,有望让机器更好地倾听。7月29日,该公司通过API提供了GPT-Live-Transcribe和GPT-Transcribe,它们不再仅仅是将声音转换为文本。这些模型正在学习理解词语背后的上下文——口音、技术术语、数字甚至背景杂音都不再轻易干扰它们。

两个模型,两种优势

每个模型都有自己的定位。GPT-Live-Transcribe专为实时、低延迟场景而构建——可以将其视为能够实时跟上说话者的速记员。它的价格为每分钟0.017美元,约合人民币12分。而GPT-Transcribe则专注于完整的音频文件和批量处理。它采用异步方法,每分钟仅需0.0045美元,约合3分,非常适合录制后的批量转录。

上下文理解的突破

真正的飞跃在于上下文理解。在Context Aware ASR基准测试中,GPT-Transcribe的语义准确率从无上下文时的41.6%提升到提供自由形式上下文时的45.2%。这意味着模型开始理解同一个词在不同对话中可能意味着不同的事物——这是迈向更自然语音交互的关键一步。

超越Whisper

与OpenAI早期的Whisper模型相比,新模型处于不同的水平。在Common Voice数据集上对22种语言的测试中,GPT-Transcribe将词错误率降低到19.27%,而Whisper(whisper-1)的错误率为40.37%——错误数量超过两倍。在九种语言的真实世界录音中,GPT-Transcribe的错误率仅为8.98%,远优于Whisper的15.21%。

这意味着什么

当机器能够在嘈杂环境中清晰理解专业术语时,语音交互的大门就会更敞开一些。这些改进可以使语音助手、转录服务和实时翻译在日常使用中更加可靠和有用。

关键点

  • OpenAI发布了两个新的转录模型:GPT-Live-Transcribe(实时,0.017美元/分钟)和GPT-Transcribe(异步,0.0045美元/分钟)。
  • 这些模型比Whisper更好地理解上下文、口音和背景噪音。
  • GPT-Transcribe在Common Voice上的错误率降至19.27%(Whisper为40.37%),在真实世界录音中为8.98%(Whisper为15.21%)。
  • 提供上下文后,上下文感知准确率从41.6%提升到45.2%。