Claude 接管 Anthropic 四分之一研发工作
Anthropic 刚刚让我们难得地一窥幕后:其自家的 AI Claude 如今正承担该公司研发工作的很大一部分。有多大?截至 8 月,Claude 主导了 26% 的研发任务——相比仅仅六个月前的不足 1%,这是一次惊人的飞跃。
六级自动化阶梯
为了追踪 AI 实际承担了多少工作,Anthropic 使用了一个六级框架。在 AL4 级别,AI 掌握方向盘:人类设定目的地,Claude 完成大部分旅程,人们进行监督和审查。目前,超过 90% 的研发工作达到该级别或更高。但问题在于——没有任何任务达到完全自主(AL5)。人类仍然掌握着钥匙。
这种人工监督并非只是形式。大约 3 万个由 Claude 驱动的智能体在并行工作,相互分配任务、交叉检查错误,并在 8 月单月就产生了 超过 10 亿次决策。每一步操作在执行前都会经过在线安全检查,任何可疑情况都会被当场拦截。该系统还会对对话进行抽样,并将高风险案例标记出来供人工审查。
代码,代码,还是代码
对编码的影响显而易见。如今,合并到 Anthropic 代码仓库中的代码有超过 80% 由 Claude 编写。工程师们表示,他们的生产力成倍提升。这些智能体处理繁重的工作——运行模型实验、编写代码、分析数据、验证结果——甚至帮助迭代下一代 Claude 本身。业界称之为递归自我改进,而它正在当下发生。
更大的图景
Anthropic 的实验提出了一个每家科技公司很快都将面临的问题:在失去控制之前,你能把多少工作交给 AI?目前,答案是“很多,但不是全部。”该公司押注的是,让人类保持在环路中——至少目前如此——是让 AI 构建 AI 的最安全方式。
关键要点
- Claude 如今承担了 Anthropic 26% 的研发任务,而 2 月时还不足 1%。
- 超过 90% 的研发工作达到人机协作(AL4)或更高水平,但没有一项是完全自主的。
- 3 万个 AI 智能体每月产生 10 亿次决策,并配有安全检查与人工审查。
- 超过 80% 的合并代码由 Claude 生成,提升了工程师生产力。
- AI 参与构建下一代 Claude 模型,这是迈向递归自我改进的一步。