三星发布三款折叠新机,面壁智能 MiniCPM 端侧大模型首次进入其全球旗舰产品线 Galaxy AI,提供文本理解与多模态感知能力,标志着国产端侧大模型正式跻身国际头部手机厂商核心供应链。
宇树科技发布人形机器人通用智能模型UnifoLM-OminiA-0.3,实现全模态交互与环境感知到自主执行的闭环。搭载该模型的G1机器人能完成搬抱枕、识别物体颜色数量、精准抓取药盒、整理衣物、收纳餐盘及调节设备等家居康养多场景任务。
Meta正研发一款全天候多模态感知智能眼镜原型,支持“超级感知”,每隔几秒自动录音和拍照,用户可通过Meta AI对获取内容即时提问。为消除隐私顾虑,设备不保存原始音视频,只提取元数据上传。
华为于4月23日发布全新鸿蒙座舱HarmonySpace6,全面升级舱内感知、智慧交互和移动影音功能。新一代智能助手小艺采用MoLA2.0架构,拥有千亿级参数,通过多模态大模型实现全场景聊天,可同时处理导航、控制等任务,显著提升车内智能体验水平。
全新多模态推理模型,支持图文输入、文字输出,具备高精度图像感知与复杂推理能力。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
-
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$2
$20
$6
$24
$8
$240
52
Qwen
Qwen3-VL-8B-Thinking是通义千问系列中最强大的视觉语言模型,具备增强推理能力的8B参数版本。该模型在文本理解、视觉感知、空间理解、长上下文处理等方面全面升级,支持多模态推理和智能体交互。
Qwen3-VL-4B-Instruct是通义系列最强大的视觉语言模型之一,在文本理解、视觉感知、空间理解、视频处理等方面全面升级,支持在多种硬件设备上运行,具备卓越的多模态推理能力。
unsloth
Qwen3-VL是迄今为止Qwen系列中最强大的视觉语言模型,在文本理解与生成、视觉感知与推理、上下文长度、空间和视频动态理解以及智能体交互能力等方面都进行了全面升级。该模型采用混合专家(MoE)架构,提供卓越的多模态处理能力。
Qwen3-VL是通义系列最强大的视觉语言模型,在文本理解与生成、视觉感知与推理、上下文长度、空间和视频理解能力等方面全面升级,具备卓越的多模态交互能力。
cpatonn
Qwen3-VL是通义大模型系列最强大的视觉语言模型,在文本理解、视觉感知、空间理解、视频处理等方面全面升级,提供卓越的多模态能力。
BAAI
Emu3是仅通过下一词元预测训练的全新多模态模型套件,在生成与感知任务中均超越多个专业模型