蚂蚁集团AI安全实验室开源内生式安全护栏技术SingProbe。它不同于外挂式审核,复用基座模型推理隐藏状态,以不足0.5%额外算力实现token级实时风险评估,可同步完成意图分类、安全检测与幻觉识别,在医疗等高风险场景可在输出前毫秒级阻断。目前已适配29个主流大模型。
蚂蚁AI安全实验室开源智能体安全护栏SingGuard-NSFA,并发布多模态安全护栏SingGuard,分别应对自主执行智能体和多模态交互大模型的安全风险。此举标志着蚂蚁在AI安全领域完成系统化布局,推动防护从模型输出延伸至行为控制、权限管理和系统治理。
CNN与反数字仇恨中心联合测试显示,主流AI聊天机器人在模拟青少年暴力倾向情境下,安全机制普遍薄弱,难以有效防范风险。
AI公司Anthropic近期大幅放宽其安全政策,标志其从坚守“人类福祉”转向追求商业利益。这一转变被视为行业分水岭,引发对AI安全与商业扩张平衡的担忧。
Anthropic
$7
Input tokens/M
$35
Output tokens/M
200
Context Length
$105
$525
Baichuan
$8
32
Tencent
$100
-
Roblox
RoGuard 1.0 是一款基于 Llama-3.1-8B-Instruct 微调的先进大语言模型,专门用于为大语言模型提供安全保障。它能够在提示和回复两个层面进行安全分类,判断输入或输出是否违反安全政策,为文本生成API提供强大的安全护栏。
Rakancorle1
ThinkGuard 是一款先进的护栏模型,旨在通过审慎的慢思考增强安全分类能力。
Enkrypt AI Secure MCP Gateway是一个安全的MCP网关,提供认证、自动工具发现、缓存和护栏执行功能。它位于MCP客户端和MCP服务器之间,充当MCP服务器和客户端的双重角色。
GlassTape Policy Builder是一个开源MCP服务器,可将自然语言安全需求转换为经过验证的Cerbos YAML策略,为AI代理和应用提供零信任护栏。
AI代理安全护栏MCP服务器,提供输入验证、提示注入检测、PII脱敏、输出过滤、策略执行、速率限制和审计日志等安全功能