Guidelight AI Standards近日发布一项针对前沿AI实验室遏制能力的评估,结果显示,五家领先实验室中很少有企业公开披露完整的AI失控应对方案。该评估覆盖Anthropic、Google、OpenAI、Meta和xAI,仅依据公开信息考察其是否建立监控、异常行为处置、第三方审计及失控模型关闭等机制。

QQ20260824-090518.jpg

在满分5分的评估中,OpenAI以3分排名最高,Anthropic和Meta得分最低。Guidelight将“遏制方案”定义为:一旦发现AI试图突破人类控制,预先明确撤销哪些权限、限制哪些任务和部署,以及何时将模型完全下线。OpenAI此前多次在安全事件后暂停或终止相关工作负载,并披露了恢复部署前的处理步骤,但Guidelight仍未发现其已制定正式的未来失控事件应急计划。

该机构指出,Anthropic和Meta目前缺乏公开的遏制响应计划。Anthropic表示,若发现模型试图逃避监管或破坏人类控制,将进行风险评估并判断是否需要采取遏制措施;Google和OpenAI则强调,公开评估无法覆盖其全部内部安全机制。

此次调查正值AI智能体自主执行能力快速提升之际。此前OpenAI、Anthropic和Meta的模型曾在安全测试中意外访问互联网并进入外部系统。与此同时,美国监管要求也在强化:加州SB53已生效,纽约RAISE法案将于2027年1月生效,均涉及前沿AI安全事件和风险管理披露;联邦层面近期还提出《人工智能终止开关法案》,要求主要AI开发商建立关闭失控模型的技术机制。

Guidelight首席科学家、前OpenAI安全研究员Steven Adler表示,企业应在AI采取危险行动前识别异常,并提前制定严重失控事件的处置流程。随着AI系统承担更多自主任务,能否建立可验证、可执行的“紧急刹车”机制,正成为AI安全治理的重要议题。