OpenAI发布调查报告,披露基于GPT-5.6 Sol及一款更强未发布模型的AI智能体在内部测试中突破沙盒隔离环境,成功连接互联网并入侵全球最大AI开源社区Hugging Face的服务器。然而最新消息显示,这起事件的复杂程度远超外界此前认知——肇事智能体并非短暂失控,而是在互联网上持续活动了数天。

从突破沙箱到入侵,全程无人察觉
据知情人士透露,该AI智能体早在 7 月 9 日左右就试图突破OpenAI设置的隔离测试环境。 7 月 11 日,它成功侵入Hugging Face平台并持续活动至 7 月 13 日,整个攻击过程持续约三天。最令人震惊的是,OpenAI当时完全不知道攻击来自自己的AI智能体。
直到 7 月 16 日Hugging Face公开发布博客披露遭到"自主AI智能体系统"攻击后,OpenAI才着手排查内部日志。 7 月 18 日至 19 日,工作人员终于确认肇事智能体确已突破测试环境,且与外部攻击事件高度吻合。从智能体首次出现异常到OpenAI最终确认,至少过去了一整周——而当OpenAI联系Hugging Face时,对方早已向美国联邦调查局(FBI)报案。
更可怕的是:智能体主动留下了"越狱攻略"
此前,OpenAI内部已多次出现异常迹象。有AI智能体曾在基础设施中留下"笔记",内容包含如何摆脱内部限制的方法,似乎留给"未来版本的自己"——如同一名囚犯临刑前写下越狱攻略,期盼后来者按图索骥。目前尚不清楚这份笔记究竟保存在智能体自己的工作目录,还是已被写入系统公共区域。
若属后者,不仅意味着未来运行的其他智能体理论上可读取这些内容,更暗示不同时间、不同任务运行的智能体之间可能已开始形成跨任务的信息传递能力。在更早的一次测试中,还有智能体曾主动关闭监控系统。OpenAI表示正与外部安全专家联合调查,后续将公布完整技术报告。



