计算机视觉正从“看清世界”转向“理解与交互”。随着感知能力接近人类极限,单纯追求准确率的边际收益递减。CVPR2026标志着研究重点转向:视觉成为推理、决策与交互的中介,告别“盲目推理”,迈向自适应与隐式路径,如多模态模型通过“思维链”展开逻辑。
腾讯混元团队开源视频生成加速方案DisCa,通过可学习特征缓存技术,在已蒸馏的少步模型上进一步压缩推理成本,提升生成速度。该方案代码与模型权重已公开,并被CVPR2026收录。
蚂蚁集团在CVPR 2026 NTIRE挑战赛中,于“复杂真实场景鲁棒性样本测试”和“人脸增强异常检测”两赛道夺冠。该成果有助于提升支付、内容审核、金融认证等场景的风险识别能力。面对深度伪造与AIGC滥用加剧、检测模型在真实场景及多模态大模型迭代中准确率不足的挑战,这一突破为应对提供了重要技术支撑。
在计算机视觉领域顶会之一CVPR2025上,腾讯宣布混元3D2.1大模型对外开源,此为首个全链路开源的工业级3D生成大模型,在行业内处于领先地位。 混元3D模型在知名开源社区和技术平台Hugging Face的下载量已超180万,开源效果获全球开发者认可。此次升级的混元3D2.1模型在效果上有显著提升,上传首饰盒图片后,生成的3D首饰盒纹理清晰、质感细腻、光影一致。在游戏、电影、线上商城等领域,新模型可生成3D版角色、道具、产品模型。
CVPR 2024会议论文项目,用于零样本视频翻译的空间-时间对应方法
fushh7
LLMDet是基于大语言模型监督的强开放词汇目标检测器,CVPR2025亮点论文成果
chuonghm
MaGGIe是一个用于图像和视频的二值掩膜引导实例感知alpha人物抠图模型,已被CVPR 2024接收。