谷歌DeepMind推出GenCeption模型,将视频生成AI逆向改造为视觉分析引擎,单一模型即可同时完成深度估计、图像分割、3D姿态估计等五项核心视觉任务。模型基于阿里通义万相Wan2.1框架训练,一次前向传播实现预测,打破任务孤立格局。
谷歌DeepMind发布GenCeption,基于预训练视频生成模型,统一解决深度估计、图像分割、3D姿态估计等任务,性能接近或超越专用模型,且训练数据需求远低。这挑战了当前以Segment Anything、Depth Anything等专用模型为主的格局。
商汤科技开源多任务视觉模型SenseNova-Vision-7B-MoT,集成目标检测、OCR、深度估计、法线估计、图像分割与多视图处理等核心视觉任务于7B参数单一架构,为视觉理解及GUI智能体开发提供高效基座。
7月7日,蚂蚁旗下灵波科技发布LingBot-Depth2.0空间感知模型,基于1.5亿数据训练,提升边缘清晰度、细小物体识别、远距离深度估计及复杂场景鲁棒性。该模型为机器人“眼睛”,1.0版已解决透明、反光难题,2.0进一步升级。
Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
将单目视频转换为沉浸式立体3D视频的框架
从日常动态视频中快速、准确地估计相机和密集结构
高分辨率、高精度的深度估计方法
Openai
-
Input tokens/M
Output tokens/M
Context Length
Anthropic
$105
$525
200
Alibaba
$2
$20
Bytedance
$0.8
256
Moonshot
$4
$16
$0.15
$1.5
Tencent
$1
32
$8
$0.4
128
$8.75
$70
400
$0.63
$3.15
131
Chatglm
Deepseek
Iflytek
$3.5
$12
facebook
MapAnything是一个端到端训练的Transformer模型,能够以多种模态作为输入,直接回归场景的分解度量3D几何结构。该模型支持超过12种不同的3D重建任务,包括多图像SfM、多视图立体视觉、单目度量深度估计等。
DINOv3是Meta AI开发的一系列通用视觉基础模型,无需微调即可在广泛的视觉任务中超越专门的先进模型。该模型采用自监督学习方式,生成高质量的密集特征,在图像分类、分割、深度估计等多种任务中表现出色。
jasperai
基于潜在桥接匹配(LBM)技术的图像深度估计模型,通过潜在空间桥接实现快速图像转换
xingyang1
Distill-Any-Depth是一种新的SOTA单目深度估计模型,采用知识蒸馏算法训练而成。
Distill-Any-Depth是一种基于知识蒸馏算法训练的SOTA单目深度估计模型,能够高效准确地进行深度估计。
keetrap
Distill-Any-Depth 是一个用于深度估计的模型,基于 transformers 架构,适用于从图像中估计深度信息。
jingheya
莲花模型系列中的深度估计模型,采用扩散模型技术实现高质量密集预测
prs-eth
基于潜在扩散模型的单目深度估计模型,支持高分辨率图像处理
zysong212
DepthMaster是一个经过驯化的单步扩散模型,将扩散模型中的生成特征定制化以适应判别式深度估计任务。
depth-anything
Prompt Depth Anything 是一种高分辨率且精确的度量深度估计方法,通过提示(prompting)释放深度基础模型的潜力,能够生成高达4K分辨率的精确度量深度。
Prompt Depth Anything 是一种高分辨率且精确的度量深度估计方法,采用提示机制释放深度基础模型的潜力。
一种高分辨率精确度量深度估计方法,采用提示机制释放深度基础模型的潜力
cyun9286
Align3R 是一个从单目视频中估计时间一致的视频深度、动态点云和相机姿态的模型。
KeighBee
DepthPro 是一种单目深度估计模型,能够通过单张图像预测深度。
apple
DepthPro是一个用于零样本度量单目深度估计的基础模型,能够生成高分辨率、高精度的深度图。
RollingDepth是一种无需视频模型的视频深度估计方法,能够实现单目深度估计和视频深度估计。
Lotus是一个基于扩散模型的视觉基础模型,专注于高质量密集预测任务,如深度估计。相比前一版本,本模型在视差空间(逆深度)进行训练,实现了更优性能和更稳定的视频深度估计。
Lotus是一个基于扩散模型的视觉基础模型,专注于高质量密集预测任务,特别是深度估计。相比前一版本,本模型采用视差空间(逆深度)训练,实现了更优性能和更稳定的视频深度估计。
onnx-community
DepthPro 是一个用于深度估计的视觉模型,能够从单张图像预测场景的深度信息。
一款零样本单目测距深度估计基础模型,能合成具有无与伦比锐度和高频细节的高分辨率深度图