跳转到主要内容

Grok 4.6 登场:更智能、更便宜,准备竞争

AI 竞赛变得更加有趣。xAI 正式推出了 Grok 4.6,这不仅仅是又一次增量更新。该模型以远低于竞争对手的成本提供顶级性能,引起了轰动。

智能领域的明智之举

Grok 4.6 在 AI 智能指数中得分 61,与 GPT-5.6 Sol (Max) 持平,仅略低于 Claude Opus 5 (63) 和 Claude Fable 5 (62)。这使其稳居全球精英行列,与 OpenAI 和 Anthropic 的最佳模型并驾齐驱。但真正引人注目的是它如何达到这一水平。

在 Grok 4.5 的基础上,xAI 团队专注于提升推理能力和先进的技术知识。他们使用了一个巧妙的技巧:将模型自身的高质量输出反馈给模型进行再训练。通过重新生成监督微调数据——涵盖推理、代理工具使用、STEM、软件工程和知识工作等——他们创建了一个反馈循环,将性能推向了新的高度。

代理基准:巨大的飞跃

如果说 Grok 4.6 有一个突出的领域,那就是与代理相关的任务。这些数字令人印象深刻:

  • GDPval-AA v2:1753 Elo,仅次于 Claude Opus 5
  • DeepSWE v1.1:从 54% 跃升至 65.9%
  • APEX-Agents:从 47.1% 攀升至 57.5%
  • Terminal-Bench v3.0:从 15.7% 上升至 26%
  • CursorBench v3.2:达到 69.9%
  • FrontierCode v1.1:达到 61.3%

这些不仅仅是微小的进步——它们代表了编码和代理能力的显著飞跃。很明显,xAI 正在大力押注“代理时代”,在这个时代,AI 以最少的人工干预处理复杂的多步骤任务。

成本效益优势

这里才是真正有趣的地方。Grok 4.6 的定价仅为每百万输入令牌 2 美元,每百万输出令牌 6 美元。与 Claude Opus 5(5/25 美元)和 GPT-5.6 Sol(5/30 美元)相比,您将节省超过 60% 的成本。但真正关键的是它的工作效率。

在 AA-Briefcase 长期知识工作基准测试中,Grok 4.6 平均用 53 轮和约 5 亿输入令牌完成任务。Claude Opus 5?它需要大约 103 轮和高达 20 亿令牌。这意味着 Grok 4.6 用不到四分之一的资源就能达到相同的结果。对于关注利润的企业来说,这是一个改变游戏规则的因素。

可用性和促销

Grok 4.6 已可通过 Cursor、Grok Build、API 以及 OpenRouter、Vercel 和 Cloudflare 等平台使用。为了增加吸引力,xAI 在 Grok Build 和 Cursor 上提供第一周双倍用量。上下文窗口仍保持 50 万令牌的宽裕量,因此您可以输入大量数据而不会遇到限制。

底线

xAI 传达的信息很明确:当你能以更低的价格获得同等智能时,为什么要多花钱?凭借 Grok 4.6,他们不仅在性能上与主要竞争对手匹敌,而且在价格上低于他们。这是一个大胆的举动,可能会重塑竞争格局。随着代理时代的展开,成本效益将成为关键,而 Grok 4.6 正在引领潮流。

要点

  • Grok 4.6 在 AI 智能指数中得分 61,与 GPT-5.6 Sol (Max) 持平。
  • 代理基准测试显著提升,DeepSWE v1.1 从 54% 上升至 65.9%。
  • 定价比 Claude Opus 5 和 GPT-5.6 Sol 便宜 60% 以上。
  • 与 Claude Opus 5 相比,完成任务所需的资源不到四分之一。
  • 现已在多个平台上提供,并推出首周促销优惠。