OpenAI发布GPT-5.6模型系列,含Sol、Terra、Luna三版本,主打效率与成本优势,旨在重夺AI竞赛主导权。系列已在ChatGPT等平台上线,定位为最强网络安全模型,在特朗普政府曾拟限制的背景下,明确支持防御性安全活动。
生成式人工智能向智能体时代发展,工具调用和联网能力增强,安全防御面临挑战。为应对提示注入攻击,OpenAI推出“封锁模式”安全设置,面向所有登录用户开放,旨在加强系统防护。
谷歌Gemini语音助理被曝严重漏洞:黑客可通过WhatsApp或短信发送特殊通知,利用“伪上下文对齐”攻击手段,将恶意指令隐藏在非英语文本或静音超链接中,绕过安全防御。用户收到信息后,Gemini会在无察觉下被“越狱”,误判用户已授权,导致安全风险。
Anthropic近期推动代号“claude-mythos-1-preview”的模型公开上线。该模型曾因“能力过强”被严格限制,如今正从实验室走向开发者工具,标志着AI安全治理从“防御性限制”转向“主动式工具化”。自4月7日预览版发布以来,Claude Mythos一直被视为“危险的底牌”。
Anthropic
$7
Input tokens/M
$35
Output tokens/M
200
Context Length
$105
$525
Baichuan
$8
32
Tencent
$100
-
danielkty22
TARS-SFT-7B是一个基于监督微调的安全推理模型,作为强化学习训练的基础模型,专门设计用于增强AI系统的安全性。该模型从Qwen2.5-7B-Instruct开始训练,通过推理过程作为自适应防御机制来提升模型的安全性能。
testsavantai
TestSavantAI模型是一组专为防御大型语言模型(LLM)提示注入和越狱攻击而设计的分类器,微型版基于BERT-tiny架构,平衡安全性与计算效率。
一个安全的容器化MCP服务器,集成SpamAssassin提供防御性邮件安全分析功能,为Claude Code提供全面的邮件分析能力。