Claude 现已承担 Anthropic 26% 的研发工作——这是一个警告信号
Anthropic 为 AI 自我改进给出了一个数字
9 月 17 日,Anthropic 发布了一篇博客文章,做了一件不寻常的事:它量化了其自身 AI 研究中有多少是由 AI 完成的。标题数字——26% 的内部研发工作由 Claude 主导——听起来可能不算多,直到你考虑到仅仅六个月前这个数字还不到 1%。
在任何给定时刻,大约有 30,000 个 AI 代理 在 Anthropic 的内部平台上运行。仅在 8 月份,它们就做出了超过 10 亿次决策。这不是演示;这是日常工作流程。
从“修复它”到全流程修复
Anthropic 使用了 Epoch AI 的六级自动化框架,其中 AL0 表示无 AI 参与,AL5 表示完全自主。截至 8 月,26% 的研发任务达到 AL4——人类设定高层目标,Claude 端到端处理其余工作。超过 90% 达到至少 AL3,即 AI 与人类协作。
一个深夜的数据管道故障说明了这种转变。工程师只是告诉 Claude:“修复它。”AI 检查日志,找到根本原因,编写修复代码,测试它,处理新错误,重新运行管道,比较结果,并写下解释。无需人工手写代码。
但 Anthropic 谨慎地指出:所测量的工作中没有一项达到 AL5,即完全自主水平。
数字背后的安全网
所有代理操作在执行前都经过在线监控。在 8 月的 10 亿次决策中,约 0.002% 被阻止。离线监控每周标记约 100,000 条对话记录;在过滤误报后,只有约 50 条被升级到人工审核。
在计算方面,在 7 月的一个样本周中,约 6% 的 AI 研发算力 用于安全研究。如果只计算 AI 驱动的研发,这一比例上升到 12%。Anthropic 承认“AI 协作”和“AI 驱动”之间的界限是主观的——跨实验室比较需要第三方验证。
RSI 竞赛升温
递归自我改进(RSI)是当前 AI 领域最热门的词汇。智谱的唐杰昨天表示,GLM-5.3-Flash 在两周内完全部署在国产芯片上,主要由一个 Infra Agent 完成。他认为完全的 RSI 还很遥远,但“模型优化系统和服务模型”的循环已经开始。
OpenAI 在 9 月初宣布,其在自动化 AI 研究实习生方面达到了一个里程碑,目标是到 2028 年 3 月实现自动化 AI 研究员。Google DeepMind 的 AlphaEvolve 已经为下一代 TPU 贡献了电路设计——Jeff Dean 称之为“TPU 大脑帮助设计下一代 TPU 身体”。
正如 Google DeepMind 的战略主管 Jagjeet Saini 所说:RSI 正在成为 AI 资本支出的核心投资逻辑。当前收入无法证明支出的合理性,但不押注 RSI 是不明智的。
为什么 Anthropic 亮出了底牌
通过发布这些数字,Anthropic 做了两件事。首先,它邀请社会在人类仍然掌握方向盘的时候帮助引导 AI 自我迭代。其次,它设定了一个基准:一旦你披露研发自动化率、代理规模、算力分配和安全覆盖,透明度本身就成为竞争压力。不跟进可能看起来像是在隐藏什么。
关键点
- Anthropic 26% 的研发现在由 Claude 主导,高于 2 月份的 <1%。
- 30,000 个代理 每月做出 10 亿次决策;0.002% 被安全监控阻止。
- 没有工作达到完全自主(AL5),但 90% 以上至少是 AI 协作的。
- 6% 的研发算力 用于安全;如果只计算 AI 驱动的工作,则为 12%。
- 竞争对手 OpenAI、Google DeepMind 和智谱都在竞相实现自动化研究——但各自的里程碑不同。