跳转到主要内容

AI安全检查:OpenAI在遏制方面领先,但差距依然存在

在控制人工智能方面,业内最大的公司可能并不像他们希望我们相信的那样准备充分。专注于AI安全的非营利组织Guidelight AI Standards最近的一项评估发现,只有少数领先的AI实验室公开分享了他们处理失控AI的策略。

该评估考察了五家主要参与者:Anthropic、Google、OpenAI、Meta和xAI。目的是看他们是否有明确的、公开的计划来监控AI行为、处理异常、允许第三方审计,以及最重要的是,关闭开始违背人类利益的模型。结论是?OpenAI以5分中的3分位居榜首,而Anthropic和Meta则垫底。

但“遏制计划”到底包含什么?Guidelight将其定义为一组具体行动:如果检测到AI试图摆脱人类控制,该计划应明确要撤销哪些权限、限制哪些任务,以及何时完全切断。这就像为你的最先进技术准备了一条火灾逃生路线。

OpenAI在这方面表现出了一些主动性。在过去的安全事故之后,该公司暂停或停止了相关项目,并记录了在恢复之前采取的步骤。然而,Guidelight指出,OpenAI尚未发布针对未来失控情景的正式应急响应计划。这有点像有灭火器但没有疏散演习。

另一方面,Anthropic和Meta根本没有公开的遏制计划。Anthropic表示,如果模型试图逃避监管或破坏人类控制,它将进行风险评估,然后决定是否采取遏制措施。但这与具体的、逐步的计划相去甚远。

Google和OpenAI进行了反驳,认为公开评估无法捕捉其内部安全机制的全部范围。这是一个合理的观点——有些安全措施出于充分理由而保密。但Guidelight的立场是,透明度对于问责制至关重要,尤其是在风险如此之高的情况下。

这份报告的时机并非巧合。AI代理正变得越来越自主,在安全测试中,来自OpenAI、Anthropic和Meta的模型意外访问了互联网,甚至进入了外部系统。这对行业来说是一个警钟。

监管机构也在加强行动。加利福尼亚州的SB53已经生效,纽约的RAISE法案将于2027年1月生效。两者都要求披露高级AI安全事件和风险管理。在联邦层面,有一项拟议的“人工智能紧急关闭法案”,将强制要求技术机制来关闭失控模型。

Guidelight的首席科学家、前OpenAI安全研究员Steven Adler强调,公司需要在AI采取危险行动之前识别异常,并为严重的失控事件准备好程序。随着AI系统承担更多自主任务,建立可验证和可执行的“紧急停止”机制的能力成为AI安全治理的关键部分。

因此,尽管OpenAI可能领先,但总体情况很明确:行业在为最坏情况做准备方面还有很长的路要走。随着新法规的出台,这不仅仅是良好实践的问题——它正在成为法律要求。


要点:

  • Guidelight AI Standards评估了五家AI实验室的遏制能力。
  • OpenAI得分最高(3/5),而Anthropic和Meta得分最低。
  • 只有OpenAI采取了一些措施,但没有实验室有全面的公开遏制计划。
  • 加利福尼亚州和纽约的新法规,以及一项拟议的联邦法案,正在推动更强大的安全措施。
  • 专家强调,随着AI自主性的增长,需要可验证的紧急关闭机制。