阿里巴巴发布千问具身智能大模型Qwen-Robot系列,包括操作模型、移动模型和世界模型三大核心,实现机器人操控、导航与物理规律推理协同。其中Qwen-RobotManip通过80维设计,解决了传统VLA模型在硬件和场景迁移时能力不足的痛点,标志着大厂在具身智能基础模型领域的深化布局。
2026年5月,自变量机器人开源VLA模型Wall-OSS-0.5,实现零样本部署突破,打破传统“考前微调”范式,推动具身智能从定制脚本向通用大脑转变。
小米近日开源了视觉-语言-动作大模型Xiaomi-Robotics-0的真机后训练全流程,推动具身智能发展。团队仅用约20小时任务数据训练,就让机器人掌握精准收纳耳机等高难度操作,展示了快速学习复杂技能的能力。
小米继2月开源VLA大模型Xiaomi-Robotics-0后,近日公布其真机后训练全流程,旨在解决机器人从实验室到实际生产的“最后一公里”问题。演示中,搭载该模型的机器人仅用20小时训练便展现出精细操作能力,推动AI机器人成为开箱即用的生产力工具。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
$8
$240
52
Bytedance
$1.2
$3.6
4
VLA-Adapter
VLA-Adapter是一种在Libero-Spatial上训练的微型视觉语言动作模型,采用Prismatic-VLM架构,仅使用Qwen2.5-0.5B作为大语言模型主干。该模型在机器人基准测试中超越了参数规模更大的开源VLA模型,实现了高性能的视觉-语言-动作理解与执行。
UCSC-VLAA
VLAA-Thinker-Qwen2.5-3B是一个类似R1的推理大视觉语言模型,专注于多模态推理任务。该模型在OpenCompass多模态推理排行榜上达到了SOTA性能,支持图像理解和复杂推理能力。