奥比中光从传统硬件供应商转型为物理AI时代的“视觉基础设施提供商”,聚焦于解决机器人“看懂”物理世界的核心瓶颈。公司通过全栈式技术矩阵,精准卡位物理AI这一全球科技竞争新领域,致力于成为产业中台,推动大模型在真实空间中的落地应用。
谷歌I/O大会上,谷歌与沃尔沃宣布合作:AI助手Gemini将接入沃尔沃纯电SUV EX60的外部摄像头,加速获取视觉与移动感知能力。此举标志着AI大模型与智能汽车硬件的深度融合取得实质性突破,得益于沃尔沃原生搭载谷歌嵌入式车载系统。
索尼官方澄清,Xperia 1XIII的“AI相机助手”并非图像编辑或生成工具,而是基于端侧视觉感知,根据实时光线、景深和拍摄对象特征,提供拍摄优化建议。当用户对准目标时,系统智能输出建议,旨在提升拍摄效果,而非篡改图像。
苹果iOS27系统将大幅升级Apple Intelligence,重点增强“视觉智能”功能。新系统不仅适用于手机,还将拓展至智能眼镜和带摄像头的AirPods等穿戴设备,旨在提升设备对现实世界的感知能力。通过先进的视觉识别技术,帮助用户更高效地处理物理世界中的图文信息。
Nano Banana Pro是强大的上下文感知AI图像编辑器,用简单文本提示创作惊艳视觉效果。
Xai
$1.4
Input tokens/M
$3.5
Output tokens/M
2k
Context Length
Anthropic
$105
$525
200
Google
$0.7
$2.8
1k
$7
$35
$2.1
$17.5
$21
Alibaba
-
$1
$10
256
$2
$20
$3.9
$15.2
64
Bytedance
$0.8
unsloth
Qwen3-VL-2B-Instruct是Qwen系列中最强大的视觉语言模型,具备卓越的文本理解与生成能力、深入的视觉感知与推理能力、长上下文支持以及强大的空间和视频动态理解能力。该模型采用2B参数规模,支持指令交互,适用于多模态AI应用。
LiquidAI
LFM2-VL-3B是Liquid AI开发的多模态视觉语言模型,基于LFM2骨干架构构建,具备强大的视觉理解和推理能力,特别在细粒度感知任务上表现出色。该模型能够高效处理文本和图像输入,支持高达512×512分辨率的原生图像处理。
Unsplash智能MCP服务器是为AI代理设计的专业图库集成方案,提供智能搜索、自动归因和项目感知的图片管理功能,简化开发者的视觉内容获取流程。
OmniMCP是一个通过Model Context Protocol (MCP)和OmniParser为AI模型提供丰富UI上下文和交互能力的项目,支持视觉感知、LLM规划、动作执行等功能,实现用户界面的深度理解和精准交互。
LA FORGE MCP 是一个为AI编程助手提供视觉感知能力的Model Context Protocol服务器,通过像素级差异对比、计算样式提取和CSS规则链分析,帮助AI准确检测CSS/HTML渲染问题,解决AI只能看代码但无法真正'看到'渲染结果的痛点。