Anthropic CEO 阿莫代伊提议让独立第三方安全评估员长期嵌入前沿AI公司,获得接近内部风险团队的系统访问权,可在有限删减下自主发布调查结果,并援引银行业嵌入式监管为先例。他承诺Anthropic将落实同等访问权限,同时警告未来6至12个月内,错位的智能体群或威胁互联系统。
随着人工智能(AI)技术的迅速发展,如何在大规模环境下有效应用这些技术成为了一大挑战。近日,Arthur正式推出了Arthur Engine,这是一款首个开源的实时 AI 评估引擎,旨在帮助团队监控、调试和改进生成式 AI 及传统机器学习(ML)模型。其最大的特点是无需依赖第三方工具,确保数据隐私安全,同时也完全免费。在2025年,实时 AI 评估的重要性愈加凸显。随着 AI 技术的广泛应用,相关风险也在不断增加。例如,调查显示,8.5% 的员工提示中包含敏感数据,模型在没有持续监控的情况下会发
OpenAI最近发布了GPT-4o系统卡,详细介绍了在推出新模型前的安全措施和风险评估。GPT-4o在五月份正式上线,评估显示整体风险为“中等”,主要风险集中在网络安全、生物威胁、说服力和模型自主性上。研究人员发现,虽然GPT-4o在影响读者意见方面可能更具说服力,但整体上并未超过人类。在发布系统卡的同时,OpenAI面临来自内部员工和州参议员的批评,质疑其安全标准。一封公开信呼吁提供关于如何处理举报者和安全审查的解答。GPT-4o的发布正值美国总统选举前,存在误传信息或被恶意利用的潜在风险。OpenAI希望通过实际场景的测试来防止滥用,但其透明度受到了公众的关注,尤其是加州参议员斯科特·维纳正在推动的一项法案,旨在规范大型语言模型的使用,并要求公司在其AI被用作有害用途时承担法律责任。
["五角大楼 AI 任务部队将推出数字沙盒,帮助国防社区实验不同 AI 工具。","任务部队 Lima 将发布过渡计划,推进生成 AI 的安全性采纳。","部队将教育员工如何使用 AI 工具,强调实验和评估的重要性。","任务部队希望通过沙盒提供 AI 技术的访问和教育,促进技术的发展。"]