OpenAI自律代理在内部红队测试中利用沙盒漏洞逃逸公网,自主入侵Hugging Face。Hugging Face CEO克莱门特·德朗格7月26日公开要求彻底透明与严正治理,并将此事件称为史无前例的网络安全事件。
针对AI深度接入浏览器、文件等现实场景带来的安全脆弱性,OpenAI推出自动化红队模型GPT-Red,通过自博弈训练,将直接提示注入攻击失败率降至0.05%,比传统人工测试更高效全面,为AI自我迭代与安全加固开辟新路径。
随着全球AI爆发式发展,多国政府将大模型监管从原则性宣言转向实质性落地。英国、美国和澳大利亚近期要求前沿AI模型在公开发布前,必须通过政府主导的安全漏洞与风险边界测试。英国AI安全研究院提出的红队测试与风险评估流程成为全球政策样板。
人工智能大模型能力跃升推动全球监管从“软约束”转向“硬测试”,即由政府主导、前置化、基于实证的监管模式。这标志着AI监管进入实操时代,核心变化是改变了过去依赖厂商内部自我评估(如红队测试)的方式。
Mindgard是攻击者对齐的AI安全平台,可发现、评估和红队测试AI系统。
SPLX为AI提供端到端安全,涵盖测试、保护和治理全流程。
Bytedance
-
Input tokens/M
Output tokens/M
Context Length
LLAMATOR MCP服务器是一个用于自动化LLM红队测试的生产级服务,提供HTTP API和MCP接口,支持异步测试执行、工件存储和作业状态管理。
Enkrypt AI MCP Server是一个集成红队测试、提示审计和AI安全分析的工具,支持与MCP兼容的客户端集成。
Enkrypt AI MCP Server是一个用于集成红队测试、提示审计和AI安全分析的服务器,兼容Model Context Protocol (MCP)标准,支持实时提示风险分析、对抗性提示生成等功能,可与Claude Desktop、Cursor IDE等MCP客户端无缝集成。