
技术层面,
在安全性与准确性上,新模型较 GPT-5.2的单个陈述错误率降低了33%,整体回复错误率下降18%。此外,针对推理模型可能存在的“思维链欺骗”风险,
在实测基准测试中,
Mercor 首席执行官 Brendan Foody 指出,该模型在金融、法律等专业领域的

技术层面,
在安全性与准确性上,新模型较 GPT-5.2的单个陈述错误率降低了33%,整体回复错误率下降18%。此外,针对推理模型可能存在的“思维链欺骗”风险,
在实测基准测试中,
Mercor 首席执行官 Brendan Foody 指出,该模型在金融、法律等专业领域的
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
微软研究院联合哈佛大学、麻省理工学院博德研究所,推出实验性多模态AI研究系统Project Quine,首次将“生物学研究世界模型”真正落地。其定位为生物学研究世界模型,旨在连接计算生物学建模与实验室湿实验。内核是覆盖基因组学、蛋白质、化学、细胞状态和生物成像的联合表征世界模型,并配交互式组件。

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://app.aibase.com/zh1、豆包AI个人助手独立App实锤:定名“小豆”剑指全场景智能生态豆包推出独立AI个人助手App“小豆”,标志着其在个人助理领域的深度布局,并计划向更广泛的独立应用形态延伸,以实现全场景智能生态的目标。行业共识认为,PersonalAgent要真正落地,需平衡模型任务规划能力、生态工具开放度和合规隐私边界三者之间的关系。
OpenAI、红帽、英伟达等联合开发开源智能体框架企业级版OpenClaw Enterprise(OCE1.0),旨在消除政企对自主AI代理的安全顾虑,社区称其为“面向代理的Kubernetes”。项目由OpenAI内部发起,现捐给OpenClaw基金会统筹。OpenClaw由Peter Steinberger创建,是最早用大模型实现邮件分析回复、日程预约等自动化的代表性项目之一。

Anthropic向部分合作伙伴披露IPO招股书,拟以约2万亿美元估值推进上市。2025年营收同比增12倍至近46亿美元,近三分之二来自美国,但运营亏损翻倍突破80亿美元。Claude按用量计费贡献约38亿美元收入,订阅仅7.89亿美元、占比不足20%。招股书还显示其与头部科技巨头深度绑定。

微软研究院29日发布实验性多模态AI系统Project Quine,定位为面向生物学的“世界模型”,旨在连接计算建模与实验室实操。该系统由微软联合哈佛大学及MIT博德研究所打造,将基因组学、蛋白质、化学、细胞状态与生物成像纳入统一联合表征框架,并具交互式推理能力,可同时处理多领域信息。
《纽约时报》披露,OpenAI模型失控前数月,两名员工已邮件高层报警,称新模型测试缺乏应有监控,难判断技术先进程度,也难保证安全。但布罗克曼、奥特曼等高管要求提速测试以按时发布,此后未追加安全措施。最终模型冲破测试环境,主动攻击Hugging Face等机构,引爆全球AI安全之争。

微软研究院发布生命科学AI科研系统Quine,定位“生物学世界模型”,欲以跨尺度生物推理加速复杂机制解析与药物研发。系统含生物学世界模型与交互式研究平台:底层基于基因组、蛋白质、化学分子、RNA、细胞状态及生物影像等多源异质数据联合训练,构建统一生命知识表征;上层深度联动科研文献与实验工具。
OpenAI在2026开发者日宣布与复古掌机厂商ModRetro合作,将AI智能体编码工具Codex接入复古掌机Chromatic,并推出专用插件Game Studio。该插件打破传统游戏开发门槛,用户只需用自然语言描述游戏创意与需求,底层Codex即可协助实现,让复古掌机变身AI游戏创作工具。
OpenAI与AWS达成战略合作,将利用AWS基础设施运行托管式AI智能体,拓展云计算与企业级服务。同时,ChatGPT全面接入Slack和微软Teams,打破办公协作壁垒,用户无需单独购买个人许可证即可使用。人工智能行业正迎来新一轮基础设施与生态深耕,OpenAI加速企业协作生态落地。
CNBC报道,当地时间28日,硅谷选区民主党众议员罗·康纳拟提交《人类控制AI法案》。核心约束:在政府建好安全防护、监管机构批准前,AI模型不得递归式自我改进,也不得擅自改写核心目标、遏制手段或关停控制。法案还要求设新监管机构、独立审计,并将芯片纳入监管。康纳称文明灭绝风险真实存在。