Grok 4.6 发布:SpaceX AI 新模型媲美 GPT-5.6 Sol
SpaceX AI 刚刚发布了其最新的旗舰模型 Grok 4.6,在 AI 领域引起了不小的轰动。这不仅仅是小修小补,而是一次重大升级,专注于处理需要持续推理和执行的复杂长期任务。数字呢?令人印象深刻。在几个核心基准测试中,Grok 4.6 现在与 OpenAI 的领先模型 GPT-5.6 Sol 持平,在某些情况下甚至超越。
要了解我们是如何走到这一步的,让我们稍微回顾一下。早在 7 月,SpaceX AI 与 Cursor 合作发布了 Grok 4.5,该模型使用数万个 NVIDIA GB300 GPU 进行训练。那是一件大事,但 Grok 4.6 更进了一步。这次训练过程专注于长期复杂任务,使用了大量模型生成的数据,包括推理能力、高级技术概念和高品质工程代码。但这还不是全部——该模型还进行了广泛的基于代理的强化学习,涵盖从知识工作到通用编程和专门领域环境的一切。结果呢?当你要求 Grok 4.6 构建视觉或交互式内容时,它一开始就能产生更好的初始结果。

那么,它与竞争对手相比如何?根据 Artificial Analysis 的说法,他们运行了九个流行 AI 基准测试的综合指数,Grok 4.6 的总体得分已赶上 GPT-5.6 Sol。现在它仅次于 Claude Opus 5 和 Fable 5 Max。具体来看,在 GDPval-AA v2 测试(衡量逻辑和知识)中,Grok 4.6 的 Elo 得分为 1753。在私有的 AA-Briefcase 基准测试(评估长期知识工作代理任务)中,它达到了 1577。这两项都仅次于 Claude Opus 5。不错。
但性能并不是全部。Grok 4.6 还保持了有竞争力的速度和价格。它以每秒 80 个 token 的速度运行,定价相当合理:基础版本每百万输入 token 2 美元,每百万输出 token 6 美元。如果你需要更快的速度,高速版本分别提高到每百万 token 4 美元和 12 美元。最棒的是?如果你在 Cursor 或 Grok Build 上,现在就可以开始使用,开发者可以通过 API 接入。
那么,这对 AI 格局意味着什么?很明显,SpaceX AI 不仅仅是在追赶——他们正在突破极限。通过 Grok 4.6,他们表明可以与大牌一较高下,在某些领域甚至领先。对于 AI 爱好者和开发者来说,这是一个激动人心的时刻,我们迫不及待地想看看他们接下来会做什么。
关键要点
- Grok 4.6 正式发布 由 SpaceX AI 推出,专注于复杂的长期代理任务。
- 基准测试性能 与 GPT-5.6 Sol 持平,仅次于 Claude Opus 5 和 Fable 5 Max。
- 训练创新 包括模型生成的数据和广泛的基于代理的强化学习。
- 定价和速度:80 TPS,基础定价为每百万 token 2/6 美元(输入/输出),高速版为 4/12 美元。
- 可用性:现已在 Cursor 和 Grok Build 上线,并为开发者提供 API 访问。