谷歌DeepMind推出GenCeption模型,将视频生成AI逆向改造为视觉分析引擎,单一模型即可同时完成深度估计、图像分割、3D姿态估计等五项核心视觉任务。模型基于阿里通义万相Wan2.1框架训练,一次前向传播实现预测,打破任务孤立格局。
谷歌DeepMind发布GenCeption,基于预训练视频生成模型,统一解决深度估计、图像分割、3D姿态估计等任务,性能接近或超越专用模型,且训练数据需求远低。这挑战了当前以Segment Anything、Depth Anything等专用模型为主的格局。