8月27日,小鹏举办“TIME 时间”物理AI分享会,第二代VLA大模型首次重大升级,XOS6.3.0将在小鹏G9L全球首发。升级核心是让AI理解时间,从静态3D空间理解跃升至动态4D时空理解,并扩大端侧模型参数量,持续验证自动驾驶Scaling Law。
小鹏汽车8月27日宣布,搭载第二代VLA大模型的Robotaxi正式开启全无人道路测试,已获广州市智能网联汽车远程测试资质,可在指定测试道路开展无人驾驶。自6月启动员工内测以来,两个月完成超2000单订单,验证线上下单、接驾到行程服务完整流程。
过去,具身智能因模型庞大、门槛极高,一直由巨头和实验室把持。7月19日,面壁智能开源首个具身AI模型系列MiniCPM-Robot,完整放出1.5B参数的视觉-语言-动作模型,让个人开发者在真实机器人上实现操作与目标跟踪,开放力度在具身领域罕见。该系列包含三个核心组件。
阿里巴巴发布千问具身智能大模型Qwen-Robot系列,包括操作模型、移动模型和世界模型三大核心,实现机器人操控、导航与物理规律推理协同。其中Qwen-RobotManip通过80维设计,解决了传统VLA模型在硬件和场景迁移时能力不足的痛点,标志着大厂在具身智能基础模型领域的深化布局。
Alibaba
$1
输入tokens/百万
$10
输出tokens/百万
256
上下文长度
$2
$20
-
$0.8
128
Baidu
32
$1.6
$4
$8
Tencent
$6
$18
$3
$9
VLA-Adapter
VLA-Adapter是一种在Libero-Spatial上训练的微型视觉语言动作模型,采用Prismatic-VLM架构,仅使用Qwen2.5-0.5B作为大语言模型主干。该模型在机器人基准测试中超越了参数规模更大的开源VLA模型,实现了高性能的视觉-语言-动作理解与执行。
vladinc
这是一个基于DistilBERT架构的回归模型,能够根据英文自由文本预测大五人格特质(开放性、责任心、外向性、宜人性和神经质),输出为0.0到1.0之间的连续值。
Hume-vla
Hume-System2是一个双系统视觉-语言-行动(VLA)模型的系统2预训练权重,用于加速系统2的训练,为机器人领域的相关研究和应用提供支持。
UCSC-VLAA
VLAA-Thinker是一个创新的视觉语言模型,能够同时处理图像和文本输入,并生成高质量的文本输出。该模型基于论文《SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models》的研究成果开发,专注于类似R1的推理能力。
VLAA-Thinker-Qwen2.5-3B是一个类似R1的推理大视觉语言模型,专注于多模态推理任务。该模型在OpenCompass多模态推理排行榜上达到了SOTA性能,支持图像理解和复杂推理能力。
Vladimirlv
基于MIT/ast-finetuned-audioset-10-10-0.4593微调的音频分类模型,专注于心音分类任务,在验证集上达到96.95%的准确率。
CogACT
CogACT是一种基于视觉语言模型(VLM)衍生的新型高级视觉语言动作(VLA)架构,专为机器人操作设计。
CogACT是一种新型视觉语言动作(VLA)架构,结合视觉语言模型与专用动作模块,用于机器人操作任务。