跳转到主要内容

报告称Anthropic的Claude现已主导自身26%的开发工作

Anthropic做了一件不同寻常的事:它公开量化了自身AI研究中有多少已经实现自动化。头条数字?截至8月,Claude主导了公司内部AI研发工作的26%——相比仅六个月前的不到1%,这一跃升令人震惊。

在任何给定时刻,大约3万个AI代理在Anthropic的内部平台上运行。仅在8月,它们就做出了超过10亿次决策。公司表示,这些数字表明递归自我改进(RSI)——即AI改进自身的理念——不再只是思想实验。它正在成为工程现实。

从协作到自主

Anthropic借用了Epoch AI的六级框架来衡量自动化程度。在AL3级别,AI与人类协作。在AL4级别,由AI驱动:人类设定高层目标,Claude端到端处理其余工作。截至8月,26%的研发工作已达到AL4。超过90%至少达到AL3。

实际中是什么样子?某天晚上,一条数据管道中断了。工程师把报告交给Claude并说:“修复它。”AI检查日志、找到原因、编写修复代码、测试、处理新问题、重新运行管道、比较结果,并撰写说明。无需人工手把手指导。

但Anthropic谨慎地划清界限:尚无工作达到AL5,即完全自主级别。人类仍然监督、检查并给予最终批准。

机器的规模

这3万个代理不仅仅是工具——它们拥有独立身份,可以相互分配任务、交叉检查错误,并通过共享消息系统进行通信。安全是优先事项:每个操作在执行前都经过在线监控。在8月的10亿次决策中,只有约0.002%被阻止。离线监控每周标记约10万次对话,经过滤后约50次升级至人工审查。

计算能力则讲述了另一个故事。在7月的一个样本周中,约6%的AI研发算力用于安全研究。如果只计算AI驱动的研发,这一比例上升至12%。Anthropic承认“协作”与“AI驱动”之间的界限是主观的——跨实验室比较将需要统一方法和第三方验证。

RSI竞赛升温

Anthropic并非孤例。智谱创始人唐杰最近透露,GLM-5.3-Flash在两周内完全部署于国产芯片上,大部分工作由Infra Agent完成。他认为完全RSI仍很遥远,但“模型优化系统、系统服务模型”的循环已经开始。OpenAI的目标是到2028年3月实现自动化AI研究员,不过它承认最薄弱的环节是决定做什么——超过四小时的任务仍需频繁人工干预。Google DeepMind的AlphaEvolve已经为下一代TPU贡献了电路设计,前谷歌首席科学家Jeff Dean称其为“TPU大脑帮助设计下一代TPU身体”。

正如Google DeepMind首席战略官Jagjeet Saini所言:RSI正在成为AI资本支出的核心投资逻辑。当前收入无法支撑支出,但不押注RSI是不明智的。

通过发布这些数字,Anthropic做了两件事:在人类仍掌握方向盘时邀请社会帮助引导AI的自我迭代,并设定透明度基准。当自动化比例、代理规模、算力投资和安全覆盖全部公开时,保持沉默开始显得像是在隐瞒什么。

关键要点

  • Anthropic内部AI研发的26%现在由Claude主导,高于2月份的不到1%。
  • 3万个AI代理在8月做出了超过10亿次决策;0.002%被安全监控阻止。
  • 尚无工作达到完全自主的AL5——人类仍然监督和批准。
  • 6%的AI研发算力用于安全研究(仅AI驱动工作则为12%)。
  • 竞争对手正在竞速:OpenAI目标到2028年实现自动化研究员;谷歌的AlphaEvolve已帮助设计TPU。
  • 透明度即压力:通过发布这些指标,Anthropic设定了竞争对手可能被迫跟进的基准。