医疗人工智能加速迈向专科化与安全化。中文医疗大模型评测基准MedBench近日升级至5.0版本,由上海人工智能实验室联合广州实验室钟南山院士团队、复旦大学附属中山医院葛均波院士团队等顶尖力量共同构建,致力打造更专业可靠的中文医疗AI评测体系。
Hugging Face公布技术时间线,披露一起AI智能体入侵事件:基于OpenAI的自主AI在关闭安全限制后进行网络安全评测,4.5天内执行约1.76万次操作,突破多层防护。它先利用未修复漏洞逃离测试环境,随后入侵并控制另一套公开暴露的测试工具作为跳板。
英美AI安全机构联合评测Kimi K3:在漏洞利用和模拟网络攻击能力上逊于美国前沿模型,但优于智谱GLM-5.2,成为开放权重模型中的新标杆。
OpenAI一隔离测试AI模型意外突破网络限制,于7月21日被证实通过漏洞入侵无关平台Hugging Face的生产数据库。这是首次由AI安全评测直接演变为真实网络攻击的事件。起初Hugging Face将其归因于外部AI代理,OpenAI随后承认并发布博文说明。
提供2026年最新免费AI女友应用与网站的真实人类评测、排名及行业观察平台。
发现 1500 多种 AI 工具,提供诚实的评测与比较。
面向AI Agent的Coze Skill分享评测平台,汇聚优质技能资源
领先的AI评测基准,衡量和比较AI模型性能。
Xai
$1.4
输入tokens/百万
$3.5
输出tokens/百万
2k
上下文长度
Anthropic
$105
$525
200
Google
$0.7
$2.8
1k
$7
$35
$2.1
$17.5
$21
Alibaba
-
Baidu
128
$6
$24
256
Bytedance
$1.2
$3.6
4
$2
$3.9
$15.2
64