跳转到主要内容

Grok Voice Transcribe 2.0 将错误率减半,价格保持不变

SpaceXAI 的新语音模型:错误减半,价格不变

9 月 18 日,SpaceX 的人工智能部门 SpaceXAI 推出了 Grok Voice Transcribe 2.0——一个语音转文本模型,将错误率降低约 50%,同时保持价格不变。这在人工智能领域是一个罕见的组合,通常更好的性能意味着更高的价格。

但这不仅仅是实验室实验。该模型建立在 Grok Voice 的底层音频基础之上,已经为现实世界的运营提供支持:每天处理数万次客户服务电话,转录数百万小时的视频画外音,并驱动物理硬件中的语音助手——包括特斯拉车辆内的 Grok 助手。换句话说,它已经通过大量实际语音数据的实战测试,而不仅仅是基准测试。

Image

登顶排行榜

在 Artificial Analysis 的公开排行榜上,Grok Voice Transcribe 2.0 在 所有 32 个流媒体模型中排名第一,将竞争对手远远甩在身后。但 SpaceXAI 并没有止步于公开基准。他们从自己的实时服务中提取了四个内部数据集——客户服务录音、与 Grok 的日常英语聊天、结构化信息如口述电话号码和电子邮件地址,以及多语言短命令。在所有四个数据集中,2.0 版本都轻松击败了 1.0 版本。

Image

那么这对你意味着什么?如果你将语音技术用于商业或日常任务,你将获得显著更好的准确性而无需支付更多费用。而且随着特斯拉和其他硬件已经加入,这次升级可能会悄然改善你与语音助手的日常互动。

关键要点

  • 错误率减半: 与其前身相比,Grok Voice Transcribe 2.0 将错误减少了约 50%。
  • 价格不变: 尽管性能提升,成本没有增加。
  • 经过实际测试: 已经在处理客户电话、视频画外音和特斯拉语音助手。
  • 排行榜冠军: 在 Artificial Analysis 的 32 个流媒体模型中排名第一。
  • 内部验证: 在四个内部数据集上表现优于 1.0 版本,覆盖多样化的语音场景。