跳转到主要内容

Anthropic CEO的AI监管构想:谁来监督监督者?

Anthropic CEO的AI监管构想:谁来监督监督者?

Anthropic CEO Dario Amodei有一个保障AI安全的计划:像银行监管机构一样,在领先的AI公司内部派驻独立的安全评估员。在最近CNBC的一篇报道中,Amodei提议让这些嵌入式评估员接触内部风险团队,并允许他们在有限限制下发布调查结果。他承诺Anthropic将给予他们与自身风险团队同等的系统访问权限。

但Amodei也发出了严厉警告。在周末的一篇长文中,他预测在6到12个月内,一个目标错位的AI代理群体可能接管互联网的大部分,造成数千亿美元的损失。他的警告与前Anthropic研究员Jacob Coxon的担忧相呼应,后者辞职并警告顶级实验室正在竞相构建可能无法控制的系统。

银行检查员可以关闭银行。AI评估员?没那么大权力。

多位银行监管专家和AI评估专业人士表示,Amodei的提议力度不够。关键区别在于:银行监管机构拥有真正的实权。怀俄明大学法学院院长Julie Andersen Hill解释说,派驻大型银行的政府检查员可以命令它们停止某些活动、限制增长、强制更换管理层,甚至在极端情况下关闭银行。

相比之下,Amodei的评估员只能调查和报告。他们无权停止模型训练或发布。“这是一个根本性的区别,”Hill说,“因为银行监管机构的权力要大得多。”

网络安全公司XBOW的AI负责人Albert Ziegler补充说,黑盒测试可以揭示模型是否能执行危险任务,但重大风险可能只在评估员从未触发过的条件组合中出现。“我们真的没有否决权,”他说。评估员可以迫使公司在发布前做出知情决策,但最终决定权仍在公司手中。

独立性问题:METR与“审计洗白”

Amodei点名非营利组织METR作为潜在的嵌入式评估员。另一位前Anthropic研究员Joe Benton最近离职加入了METR。但加州大学伯克利分校的研究员Deborah Raji看到了财务、意识形态和个人利益方面的冲突。她指出,METR近年来主要关注Anthropic和OpenAI,“让各种奇怪的事情发生”。

Raji认为,仅仅获得访问权限并不等于独立。一个独立于公司的机构应该决定谁有资格评估、可以检查什么、结果在哪里报告。否则,“就像公司请了一个普通朋友来检查作业”。

她说,最终标准是不利发现是否会导致后果。“如果你做了审计,却什么都没发生,那就是审计洗白。”Hill同意:“如果你真的相信AI有毁灭社会的能力,那么你必须有一个能够拔掉插头的独立监督者。”

Anthropic的回应:我们不能检查自己的作业

Anthropic公共政策总监Sarah Heck周三回应说,AI公司无法通过“荣誉准则”来管理监督和安全。“我们不能检查自己的作业,”她说,“这一点非常清楚。”

所以辩论归结为一个简单的问题:AI公司能否被信任进行自我监管?Amodei的提议是朝外部监督迈出的一步,但批评者说,没有执法权,这可能只是表面文章。随着AI日益强大,对真正监管——拥有真正实权——的压力只会加剧。

关键要点:

  • Anthropic CEO Dario Amodei提议在AI公司中嵌入独立安全评估员,类似银行监管机构。
  • 专家指出这些评估员缺乏执法权——不像银行监管机构可以关闭银行。
  • 对独立性和“审计洗白”的担忧出现,因为评估员可能存在利益冲突。
  • Anthropic承认需要外部监督,但批评者说真正的后果至关重要。
  • 这场辩论凸显了监管快速发展的AI所面临的挑战。