Grok 4.7:SpaceXAI 更便宜、更智能的长任务 AI
Grok 4.7 登场:更快、更便宜,为马拉松任务做好准备
SpaceXAI 今天早些时候发布了其最新旗舰模型 Grok 4.7。该公司毫不掩饰其雄心:着陆页将其标榜为“编程和知识工作的最强模型”,声称其速度是同类模型的两倍,而价格仅为其一半。这不仅仅是为了在基准测试中名列前茅——Grok 4.7 拥有更大的基础模型、增强的长期任务处理能力、自检能力以及更好的长上下文管理。SpaceXAI 还将其应用于文档、演示、法律、医疗保健和工程等专业领域,旨在减少失误,并在数小时工作后交付真正可用的结果。
埃隆·马斯克在 Twitter 上表示,Grok 4.7 在智能、速度和成本之间取得了“极具竞争力的平衡”。

长任务:新战场
那么,其内部有何玄机?Grok 4.7 使用了比其前身 Grok 4.6 更大的基础模型,并延长了训练期间的强化学习阶段。这意味着该模型要应对更艰巨的任务组合——有些样本需要数小时才能完成。据 SpaceXAI 称,新模型擅长检查自己的工作和管理长上下文,直接解决了编程代理的痛点:复杂的软件任务涉及阅读代码库、分解需求、编辑多个文件、运行测试以及无休止的调试。在长执行链中保持正轨并捕捉错误,往往比一次性写出完美代码更重要。

在针对长期编码的 CursorBench 4.0 测试中,Grok 4.7 得分 46.3%,高于上一代的 40.4%。其 DeepSWE v1.1 高推理得分达到 71.0%,Terminal-Bench 4.0 从 20.3% 跃升至 38.0%。该模型还被训练以原生理解 Grok Bot 操作框架,SpaceXAI 称这提升了对话和通用知识工作的表现。结论是什么?升级重点已从单轮回答转向模型、工具和执行环境之间的持续协作。
不止于代码:全能知识工作者
编程仍然是 Grok 4.7 的招牌,但其评估范围要广泛得多。在 AA Briefcase v1.1 上,它得分 1657 分(高于 1546 分),其 GDPval Elo 从 1605 升至 1695——接近 Fable5.1 的 1735,并领先于 GPT-6Astra 的 1542。专业领域也有所提升:EEBench 从 53.0% 攀升至 64.0%,Harvey Legal Agent Benchmark 从 15.8% 升至 19.6%,HealthBench Professional 从 48.5% 升至 56.7%。趋势很明显:前沿模型现在竞争的是“完成整个任务”,这意味着理解请求、调用工具、生成文件并进行自我审查。
在安全方面,Grok 4.7 引入了新的保护系统。SpaceXAI 声称这是迄今为止在拒绝有害回答和抵御越狱方面表现最好的。LatchBio 生物安全基准达到 62.4%,HackerBench v0.3 仅允许 3.3% 的高风险两用提示——同时很少阻止合法的安全研究。SpaceXAI 还向选定的网络安全合作伙伴开放了基于邀请的红队能力。
要点
- Grok 4.7 是 SpaceXAI 最强的模型,针对编程和知识工作,速度是竞争对手的两倍,价格仅为其一半。
- 长任务 是主要焦点:增强的自检和长上下文管理,适用于长达数小时的工作流程。
- 基准测试提升 涵盖编码(CursorBench 4.0:46.3%)、法律(Harvey:19.6%)和医疗保健(HealthBench:56.7%)。
- 安全升级 包括新的保护系统和面向合作伙伴的红队访问。
- 埃隆·马斯克 称其为智能、速度和成本的“极具竞争力的平衡”。