谷歌地球推出基于Nano Banana2模型的AI图像生成功能,融合卫星、航空与3D实景地图。网页端用户可放大目标区域,输入描述指令,直接在真实地理数据上视觉重塑现实地点。
谷歌DeepMind推出GenCeption模型,将视频生成AI逆向改造为视觉分析引擎,单一模型即可同时完成深度估计、图像分割、3D姿态估计等五项核心视觉任务。模型基于阿里通义万相Wan2.1框架训练,一次前向传播实现预测,打破任务孤立格局。
Adobe发布Photoshop和Lightroom重大更新,将生成式AI扩展至3D空间处理。核心亮点是“旋转对象”工具,允许用户在3D空间中实时旋转、倾斜或翻转2D素材,自动调整透视角度和环境视觉逻辑,显著提升合成创作效率与效果。
Anthropic宣布Claude与Adobe、Blender等八大创意软件深度互联,通过新增连接器将AI能力融入平面设计、3D建模和音频制作流程。在视觉创作领域,与Adobe的整合尤为突出,创作者可直接在常用软件中调用Claude,提升工作效率。
VoxDeck是AI制作演示文稿的领先者,打造出令人惊叹、专业且个性化的幻灯片,具备3D图表、交互式视觉和演示幻影。
创建高质量的3D模型和视觉内容,提升品牌影响力
快速将2D图像转换为3D,开启全新的视觉体验和无限可能性。
用于视觉合成的统一3D Transformer流水线
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$2
$20
-
$8
$240
52
Bytedance
$1.2
$3.6
4
$3.9
$15.2
64
$0.8
facebook
MapAnything是一个端到端训练的Transformer模型,能够以多种模态作为输入,直接回归场景的分解度量3D几何结构。该模型支持超过12种不同的3D重建任务,包括多图像SfM、多视图立体视觉、单目度量深度估计等。
unsloth
InternVL3-78B-Instruct是一个先进的多模态大语言模型,在多模态感知、推理和语言处理等方面表现出色。该模型通过原生多模态预训练方法,将视觉和语言学习整合到统一训练阶段,在工具使用、GUI代理、工业图像分析、3D视觉感知等多个领域展现出卓越能力。
InternVL3-14B-Instruct 是一个先进的多模态大语言模型(MLLM),展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种任务。
InternVL3-2B-Instruct是先进的多模态大语言模型,相比前代有更出色的多模态感知和推理能力,扩展了工具使用、GUI代理、工业图像分析、3D视觉感知等方面。采用原生多模态预训练方法,将语言和视觉学习整合到单个预训练阶段。
InternVL3-78B是一款先进的多模态大语言模型,具备卓越的多模态感知和推理能力,在工具使用、GUI代理、工业图像分析、3D视觉感知等领域表现出色,整体文本性能也十分优秀。
InternVL3-14B是一个先进的多模态大语言模型,在InternVL 2.5基础上显著提升了多模态感知和推理能力,并拓展了工具使用、GUI代理、工业图像分析、3D视觉感知等领域的应用。
OpenGVLab
InternVL3-38B是一个先进的多模态大语言模型(MLLM),在多模态感知和推理能力上有显著提升,支持工具使用、GUI代理、工业图像分析、3D视觉感知等领域。
InternVL3-9B是InternVL3系列中的一款多模态大语言模型,具备卓越的多模态感知与推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种应用场景。
InternVL3-8B是OpenGVLab推出的先进多模态大语言模型,具备强大的多模态感知与推理能力,支持工具调用、GUI智能体、工业图像分析、3D视觉感知等新领域。
InternVL3-2B是OpenGVLab推出的先进多模态大语言模型(MLLM),具备卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等。
InternVL3-78B是OpenGVLab推出的先进多模态大语言模型,展现卓越的综合性能。相比前代InternVL 2.5,具备更强大的多模态感知与推理能力,并将能力拓展至工具使用、GUI代理、工业图像分析、3D视觉感知等新领域。
InternVL3-8B-Instruct 是一个先进的多模态大语言模型(MLLM),展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种功能。
InternVL3-38B-Instruct 是一个先进的多模态大语言模型(MLLM),展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种任务。
InternVL3-78B-Instruct是OpenGVLab推出的先进多模态大语言模型,展示了卓越的多模态感知和推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种任务。
AquaLabs
EchoLLaMA是一个多模态AI系统,能够将3D视觉数据转化为自然语音描述,同时支持通过语音输入进行交互对话。
stanfordmimi
梅林是针对计算机断层扫描的3D视觉语言模型,预训练过程同时利用结构化电子健康档案与非结构化放射学报告。
naver
DUSt3R是一个用于从图像轻松实现几何3D视觉的模型,能够从单张或多张图像重建3D场景。
DUSt3R是一个用于从图像生成3D几何模型的深度学习模型,能够轻松实现几何3D视觉任务。
GoodBaiBai88
M3D-CLIP是专为3D医学影像设计的CLIP模型,通过对比损失实现视觉与语言的对齐。
VGGT-MPS是基于苹果芯片优化的3D视觉重建工具,使用Metal Performance Shaders加速,能够从单张或多张图像生成深度图、相机姿态和3D点云,支持稀疏注意力实现城市级重建。