計算機視覺正從“看清世界”轉向“理解與交互”。隨着感知能力接近人類極限,單純追求準確率的邊際收益遞減。CVPR2026標誌着研究重點轉向:視覺成爲推理、決策與交互的中介,告別“盲目推理”,邁向自適應與隱式路徑,如多模態模型通過“思維鏈”展開邏輯。
騰訊混元團隊開源視頻生成加速方案DisCa,通過可學習特徵緩存技術,在已蒸餾的少步模型上進一步壓縮推理成本,提升生成速度。該方案代碼與模型權重已公開,並被CVPR2026收錄。
螞蟻集團在CVPR 2026 NTIRE挑戰賽中,於“複雜真實場景魯棒性樣本測試”和“人臉增強異常檢測”兩賽道奪冠。該成果有助於提升支付、內容審覈、金融認證等場景的風險識別能力。面對深度僞造與AIGC濫用加劇、檢測模型在真實場景及多模態大模型迭代中準確率不足的挑戰,這一突破爲應對提供了重要技術支撐。
在計算機視覺領域頂會之一CVPR2025上,騰訊宣佈混元3D2.1大模型對外開源,此爲首個全鏈路開源的工業級3D生成大模型,在行業內處於領先地位。 混元3D模型在知名開源社區和技術平臺Hugging Face的下載量已超180萬,開源效果獲全球開發者認可。此次升級的混元3D2.1模型在效果上有顯著提升,上傳首飾盒圖片後,生成的3D首飾盒紋理清晰、質感細膩、光影一致。在遊戲、電影、線上商城等領域,新模型可生成3D版角色、道具、產品模型。
CVPR 2024會議論文項目,用於零樣本視頻翻譯的空間-時間對應方法
fushh7
LLMDet是基於大語言模型監督的強開放詞彙目標檢測器,CVPR2025亮點論文成果
chuonghm
MaGGIe是一個用於圖像和視頻的二值掩膜引導實例感知alpha人物摳圖模型,已被CVPR 2024接收。