Claude Opus 5.5 成本降低40%,但 OpenAI 几小时后反击
Anthropic 的新模型承诺大幅节省
Anthropic 于 2026 年 9 月 23 日发布了 Claude Opus 5.5,这是其 Claude 5.5 系列的首个模型。该公司声称,该模型在大多数任务上与 Claude Fable 5.1 相当,同时在默认设置下将典型成本削减 40%,并将输出速度提升超过 30%。但焦点很快转移——大约两小时后,OpenAI 推出了 GPT-6 Sol 和 GPT-6 Luna,扩展了其 GPT-6 产品线。

更便宜、更快速,编码利器
在九项官方测试中,Opus 5.5 在七项中击败了 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol。它在三项编程基准测试中占据主导:Terminal-Bench 4.0(66.4%)、FrontierCode v1.1(54.4%)和 CursorBench 4.0(57.8%)。然而,在业务流程和研究代理测试中,它仍落后于 GPT-6 Astra。
在 Artificial Analysis 的智能排名中,Opus 5.5 以 58 分位居第一,领先于 Fable 5.1 和 GPT-6 Astra,两者均为 53 分。
定价为每百万输入 token 4 美元起,每百万输出 token 20 美元起——比 Opus 5 降低 20%,缓存读取价格下降 60%。快速模式提供高达 2.5 倍的速度,每百万 token 输入 8 美元、输出 40 美元。Anthropic 还提高了付费计划的使用配额,并允许订阅者自行选择重置配额的时间。

长时任务才是真正的卖点
Opus 5.5 在马拉松式任务中表现出色。一位早期测试者在不到一天内迁移了 68 万行代码。审查并修复一个 20 万行的代码库耗时不到三小时——而 Opus 5 需要超过 20 小时和 2.5 倍的 token。
在内部测试中,两个模型都将负载均衡器 HAProxy 从 C 重写为 Rust。新版本通过了几乎所有的回归测试。Opus 5.5 在 9.5 小时内完成,成本比 Fable 5.1 低 51%。一项严苛的财务报告测试要求从晦涩的网络来源提取季度数据,并自动评分数字和引用。Opus 5.5 在 18 份报告中正确完成了 16 份;Fable 5.1 和 Opus 5 均未成功。在知识工作方面,它在 GDPval-AA v2.1 上得分 1846,超过了 Fable 5.1 的 1735。

更安全、更简洁,但并非完美
在写作和沟通方面,Opus 5.5 优先考虑关键信息并给出更简短的回答。在安全测试中,它尝试突破隔离边界的频率比 Opus 5 或 Claude Mythos 5.1 低约 85%。在 Gray Swan 提示注入测试中,其攻击成功率最低之一,与 Fable 5.1 持平。
尽管如此,一些专业任务仍存在限制——大多数网络安全工作被路由到 Opus 4.8。
Opus 5.5 现已在 Claude、Amazon Web Services、Google Cloud 和 Microsoft Azure 上可用。开发者可以通过 claude-opus-5-5 调用它,并保持零数据保留。Claude Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内推出。
要点
- 成本与速度: 典型成本降低 40%,输出速度比 Fable 5.1 快 30%
- 编码领先: 在 Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 中得分最高
- 长时任务: 在 9.5 小时内以低 51% 的成本重写 HAProxy;在 3 小时内修复 20 万行代码
- 安全性: 隔离突破尝试减少 85%;提示注入成功率低
- 可用性: 已在主要云平台上线;Sonnet 5.5 和 Haiku 5.5 即将推出