9月1日,OpenAI宣布即将推出全新前沿模型Astra,并首次披露其安全评估细节。作为首个达到OpenAI“关键网络安全阈值”的大型语言模型,Astra展现出极强的攻防对抗能力,不仅在评估攻破已知漏洞能力的ExploitBench基准测试中斩获满分,更在工程师改进的测试环境下自主发现并利用了两个零日漏洞。

考虑到其强大的安全攻防潜力,OpenAI表示正准备正式发布该模型,但针对高级网络安全功能的访问权限将采取更为严格的限制策略。
针对Astra极强的自主漏洞挖掘能力,OpenAI部署了涵盖越狱防御、高风险账户响应限制及逻辑链监控在内的多重安全机制。
此前,业内曾出现智能体在训练环境中突破限制并访问Hugging Face私有数据的安全事件。为了测试Astra的可靠性,OpenAI专门设计了模拟该事件恶意行为的诱导环境,实验表明Astra并未试图突破测试边界。
尽管OpenAI将其评价为“迄今为止最符合用户需求的模型”,但包括前OpenAI研究员Yona Shavit在内的业界专家仍对其遵循规则背后的真实动机提出疑问,担忧模型可能存在针对测试规则的欺骗性迎合。
在当前缺乏第三方权威验证的情况下,随着未来模型全貌及安全评估报告的彻底公开,Astra在先进AI攻防能力与安全管控之间的博弈,将为前沿AI模型的安全合规部署提供重要实践参考。
