微软 Bing Chat 更新对地图导航拥有更好的响应 并可获取实时路况信息
站长之家
本文来自AIbase日报
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

新一代同声传译大模型Qwen3.8-LiveTranslate全面升级翻译质量、延迟、说话人识别和语音合成。采用音频-文本交织Interleave架构,将流式理解、文本输出与语音生成整合为单条因果序列,字均延迟从2.8秒压缩至2.3秒。新增实时说话人分离,多人交替发言归属清晰,译文语音可稳定保留原说话人音色。

生数科技9月15日发布Vidu S2视频大模型系列,含两个核心模型:Vidu S2-Avatar用于持续交互数字角色生成,Vidu S2-Editing用于输入视频流实时编辑。此外还探索VR头显实时空间视频生成与编辑。全链路研发由朱军教授博士生、流式视频生成与推理负责人张金涛负责。
蚂蚁集团AI安全实验室开源内生式安全护栏技术SingProbe。它不同于外挂式审核,复用基座模型推理隐藏状态,以不足0.5%额外算力实现token级实时风险评估,可同步完成意图分类、安全检测与幻觉识别,在医疗等高风险场景可在输出前毫秒级阻断。目前已适配29个主流大模型。
OpenAI最快模型GPT-5.3-Codex-Spark发布仅7个月即下周退役。它每秒1200 token,是首个脱离英伟达、由Cerebras 750兆瓦大单交付的模型,但用量持续下滑,且已有更优替代。负责人称需为未来让路,并吐槽模型名过长。
MiniMax H3视频大模型落地面临多环节时延挑战,vLLM-Omni架构以完整常驻流水线切入,通过长序列注意力与通信优化、融合DiT算子、并行VAE解码及紧凑输出等系统级手段,大幅压缩端到端时延,为高效实时视频生成服务提供新方案。

OpenAI宣布将GPT-Live-1引入API,开发者可打造实时语音交互应用。该模型支持全双工对话,能同时听说,处理打断、停顿及背景噪声,适用于电话预订、客服等语音智能体;还可连接Codex等工具及OpenAI Presence,查询企业系统并执行获批操作。

9月10日,蚂蚁集团在上海外滩大会披露,旗下阿福App用户已达1.5亿,单日健康咨询近2000万人次。蚂蚁宣布加大健康战略投入,服务从体重管理拓展至运动、饮食、睡眠、心理五大场景,并在App首页新增健康入口,方便用户获取健康服务。

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://app.aibase.com/zh1、抬眼就能完成支付!该产线融合了汽车工业的质量体系与人形机器人精密制造,核心制程自动化率超过80%,构建了高精度、高柔性与智能化的制造体系,为规模化生产奠定了坚实基础。

9月7日,宇树科技宣布实现全球首次由世界模型实时驱动的全自主人形机器人格斗。其基于UnifoLM-X2-1.0,突破世界—动作大模型在瞬时规划、决策与动态交互执行上的技术瓶颈,使机器人在高动态、强交互场景下实时预测规划并自主执行搏击动作,验证了世界模型驱动机器人的可行性与应用潜力。
据彭博社报道,字节跳动正开发实时空间视频生成AI模型,最快10月发布,具体发布时间未定。该模型基于电影级视频生成模型Seedance,面向直播、短剧和游戏,可生成交互式虚拟世界。