跳转到主要内容

Anthropic新AI模型编程性能翻倍,成本大幅降低

Anthropic刚刚发布了其最新的AI模型Claude Fable 5.1和Claude Mythos 5.1,并做出了一些大胆的声明。该公司称它们为“世界上最先进的编程和知识工作模型”。这两个模型共享相同的基础架构,但安全级别不同:Fable 5.1对所有用户开放,而Mythos 5.1通过可信访问计划仅限经批准的网络安全和生命科学组织使用。

基准测试说明一切

在正面交锋的测试中,Fable 5.1将前代产品远远甩在身后。在Agent Science Research Benchmark(Terminal-Bench-Science 0.1)上,它获得了52.6%的分数,相比Fable 5的24.7%和Opus 5的29.0%有大幅提升。即使是OpenAI的GPT-5.6 Sol也只达到了22.4%。在编程方面,Fable 5.1在Terminal-Bench 4.0上达到了55.8%,而Mythos 5.1在更宽松的安全设置下达到了60.9%。在知识工作方面,Fable 5.1在GDPval-AA v2测试中得分1853,略高于Opus 5的1824和Fable 5的1723。

成本与性能:双赢

最引人注目的更新之一是降价。Fable 5.1的缓存读取成本暴跌了75%,现在仅为每百万token 0.25美元。对于典型工作负载,这比Fable 5节省约25%的成本,对于高度基于代理的任务,节省高达45%。基础定价保持不变:每百万输入token 10美元,每百万输出token 50美元。因此,您可以在不增加成本的情况下获得更强大的性能。

安全更智能

Anthropic还完善了安全机制。在网络安全应用中,误报(即AI阻止合法请求的烦人情况)减少了约60%。Fable 5.1现在可以帮助发现软件漏洞,但不会协助开发针对这些漏洞的利用程序。在生物领域,Anthropic与美国政府合作创建了一个访问计划,让研究人员能够利用Mythos 5.1的高级生物能力。科学家的注册预计很快开放。

现实世界的科学成就

Mythos 5.1不仅仅在基准测试中表现出色;它已经在科学领域引起了轰动。在分子设计中,它使用开源工具设计了高亲和力结合剂,其结合亲和力比Adaptyv Bio蛋白质设计竞赛中最佳条目高出十倍。在12个目标上,它的成功率接近50%,而典型的蛋白质设计成功率约为10-15%。在计算分析中,Fable 5.1处理了NASA麦哲伦任务的雷达图像,创建了金星的高分辨率高程图。分辨率从10-20公里提高到2-3公里,高程精度提高了25%。在计算生物学中,Mythos 5.1将七个开源深度学习模型的速度提高了2.5倍,可能将GPU成本降低30-60%。

数据保留与合规性

Anthropic推出了企业级安全(EFS),它结合了零数据保留和高级保护。客户数据保留在企业完全控制的云基础设施中,而不是在Anthropic的系统中。EFS将于今年秋季向企业客户推出,但符合条件的客户已经可以在零数据保留政策下使用Fable 5.1。

在合规方面,Anthropic于2026年7月签署了欧盟AI法案的实践指南。这意味着2026年8月2日之后发布的模型输出必须包含隐形水印。Fable 5.1已经做到了这一点——它对用户不可感知,不影响质量,并且不包含用户特定信息。检测API处于私有预览阶段,可供监管机构、执法部门、媒体和事实核查人员根据欧盟法律使用。

可用性

Claude Fable 5.1现已在所有主要平台上可用,包括Amazon Web Services、Google Cloud和Microsoft Azure,开发人员可以通过Claude API访问。然而,Claude Mythos 5.1目前仅限于经批准的美国组织使用。

Image

关键要点

  • 性能飞跃:Fable 5.1的编程基准测试分数相比前代翻倍。
  • 成本降低:缓存读取成本下降75%,使重度用户更能负担得起。
  • 增强安全:网络安全误报减少60%;新的生物研究访问计划。
  • 科学影响:在蛋白质设计、金星测绘和GPU优化方面的成就展示了实际效用。
  • 合规就绪:隐形水印满足欧盟AI法案要求,检测API处于私有预览阶段。