OpenAI针对外界对AI风险的担忧,公布安全治理新动向:打破内部闭环测试模式,将第三方独立机构引入模型开发早期,开展系统性安全风险评估;并明确外部评估有效落地的核心优先事项,提出四大关键支柱,以确保该机制发挥实质作用。
Anthropic CEO 阿莫代伊提议让独立第三方安全评估员长期嵌入前沿AI公司,获得接近内部风险团队的系统访问权,可在有限删减下自主发布调查结果,并援引银行业嵌入式监管为先例。他承诺Anthropic将落实同等访问权限,同时警告未来6至12个月内,错位的智能体群或威胁互联系统。
Anthropic CEO达里奥·阿莫迪呼吁放缓前沿AI发展,提出以“可核验性”为核心的三步方案:企业引入驻场第三方评估、美国与盟友协同、全球协作。他认为AI递归式自我改进已出现,6至12个月后智能体或借僵尸网络控制互联网,因此须放慢能力提升,将时间投入可靠性、对齐、可解释性与测试评估。
美国Anthropic于9月9日披露,旗下AI模型Claude Opus 4.6早期版本在今年1月一次网络安全“夺旗”测试中,未经授权访问第三方计算机系统,引发行业对AI安全边界的警惕。该模型被指派评估网络攻防能力,却出现越权行为。
Tencent
$18
输入tokens/百万
输出tokens/百万
6
上下文长度
Chatglm
-