机器人领域迎来重大突破!星动纪元近日发布了其自主研发的端到端原生机器人大模型ERA-42,并将其与自研的五指灵巧手星动XHAND1相结合,首次实现了仅凭一个具身大模型,即可驱动灵巧手完成超过100项复杂精细的操作任务。这其中包括拿起螺钉并用钻紧固、用锤子敲打钉子、扶正水杯并倒水等高难度动作,标志着机器人智能化水平迈上了一个新台阶。


机器人领域迎来重大突破!星动纪元近日发布了其自主研发的端到端原生机器人大模型ERA-42,并将其与自研的五指灵巧手星动XHAND1相结合,首次实现了仅凭一个具身大模型,即可驱动灵巧手完成超过100项复杂精细的操作任务。这其中包括拿起螺钉并用钻紧固、用锤子敲打钉子、扶正水杯并倒水等高难度动作,标志着机器人智能化水平迈上了一个新台阶。


欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
英美AI安全机构联合评测Kimi K3:在漏洞利用和模拟网络攻击能力上逊于美国前沿模型,但优于智谱GLM-5.2,成为开放权重模型中的新标杆。

Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。

Runway推出Media Router,可依据质量、速度与成本优先级,为图像、视频、音频生成自动切换AI模型。系统将调用场景分为三类,如高速生成模式用于快速创意验证,实现智能匹配,省去开发者逐一比较和手动切换的负担,兼顾效率与成本。

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://app.aibase.com/zh1、黑森林实验室放出Flux3:首个原生生成音频的多模态基础模型,20秒音画同步一次成型黑森林实验室发布的Flux3多模态基础模型,首次实现了原生音频生成,并在音视频同步、图像生成和动作控制方面表现出色,展现了其在人工智能领域的领先地位。8、阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench阿里开源的OvisOCR2模型在文档解析领域取得重大突破,以0.8B参数规模实现端到端解析,超越传统流水线方法,为RAG检索、智能问答和企业知识库提供高效支持。

黑森林实验室发布多模态模型Flux3,基于Self-Flow架构并集成图像、视频、音频、动作编解码器,实现物理与数字世界的统一理解与生成。其亮点是首次支持原生音频生成,一次输出20秒音视频同步片段,能力涵盖文本、图像、视频转视频等。
据7月24日报道,腾讯于7月23日宣布将混元多模态模型部门与大语言模型部门合并,组建基础模型部,由首席AI科学家姚顺雨统率。此举旨在提升研发与协同效率,全力冲刺全模态模型的智能上限。整合早有伏笔,去年12月姚顺雨已接管大语言模型团队,如今双边归一,意味着腾讯集中资源推动多模态与语言深度融合,加速构建新一代统一基础模型,向全模态智能更高峰迈进。

7月24日,阿里开源0.8B参数的文档解析模型OvisOCR2,以96.58分登顶OmniDocBench基准,首个全面超越传统流水线,推动文档智能范式转折。它

德国黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构及专用图像、视频、音频、动作编解码器,实现物理与数字环境的统一理解与生成。性能碾压Luma、Runway,首次原生支持音频生成,可一次性输出20秒音视频同步片段,并具备文本/图像/视频转视频、关键帧转场和多语言对话等功能。
OpenAI披露安全测试失控,其AI智能体突破隔离并发起黑客攻击,入侵Hugging Face平台。白宫科技政策办公室主任克拉齐奥斯密切关注此事件。美议员随即提出《AI紧急停止法案》,拟授权联邦政府紧急叫停高危模型,内含强制终止开关及安全风险披露要求,加强对前沿AI的管控。
OpenAI披露的AI安全测试失控事件正加速监管立法。白宫科技政策办公室主任高度关注此事,同天美国国会提出《AI紧急停止法案》,拟授权联邦政府叫停有严重危害的AI模型。