努比亚宣布9月16日发布全球首款AI智能体手机NaviX Ultra,由中兴与字节跳动联合研发,搭载豆包手机助手,被称为“豆包手机二代”。新机将调整与阿里、腾讯等超级应用合作方式,不再采用授权读屏、模拟点击的GUI方案,AI交互或生变。硬件细节尚未公布。
阿里巴巴推出 GUI 智能体基座模型 Qwen-UI-Agent,以真实世界为中心,覆盖移动端、电脑端、网页端及深度搜索,旨在突破模拟测试限制,实现复杂真实设备无缝操作。其在 MobileWorld 移动端测试中获 82.1% 高分,领先多个主流模型,综合性能全面超越行业旗舰。
阿里巴巴8月20日发布GUI智能体基座模型Qwen-UI-Agent,覆盖移动端、电脑端、网页端及深度搜索,多项核心基准超越业界旗舰。移动端MobileWorld得82.1%,分别领先GPT-5.6Sol和Claude Opus4.8达12.0和14.6个百分点,展现强劲实力。
商汤科技开源多任务视觉模型SenseNova-Vision-7B-MoT,集成目标检测、OCR、深度估计、法线估计、图像分割与多视图处理等核心视觉任务于7B参数单一架构,为视觉理解及GUI智能体开发提供高效基座。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Anthropic
$7
$35
200
$21
$105
Alibaba
$4
$16
$2
$20
-
Baidu
32
Xai
$1.4
$10.5
256
$54
$163
Deepseek
$12
128
$8.75
$70
400
$1.75
$14
$1
$15
Chatglm
$8
OpenGVLab
InternVL3-8B是OpenGVLab推出的先进多模态大语言模型,具备强大的多模态感知与推理能力,支持工具调用、GUI智能体、工业图像分析、3D视觉感知等新领域。
parasail-ai
UI-TARS是下一代原生GUI智能体模型,具备类人的感知、推理和行动能力,可与图形用户界面(GUI)实现无缝交互。
ByteDance-Seed
UI-TARS 是新一代原生图形用户界面(GUI)智能体模型,旨在通过类人的感知、推理和行动能力与图形用户界面无缝交互。
zai-org
CogAgent是基于GLM-4V-9B优化的视觉语言模型GUI智能体,在GUI感知、推理准确性、动作空间完整性和任务泛化性方面有显著提升,支持中英双语交互,已应用于GLM-PC产品。
THUDM
CogAgent是基于CogVLM改进的开源视觉语言模型,具备GUI智能体、视觉多轮对话和视觉定位等能力。