Google DeepMindがGenCeptionを発表。動画生成AIを逆転させ、単一モデルで深度推定・画像分割・3D姿勢推定など5つの視覚タスクを同時実行。AlibabaのWan2.1フレームワークで訓練し、1回の順伝播で予測可能。タスクの分断を打破。....
グーグルDeepMindが発表したGenCeptionは、事前学習済み動画生成モデルを基盤に、深度推定、画像セグメンテーション、3D姿勢推定などを統一的に解く。性能は専用モデルに匹敵または凌駕し、訓練データ要求も低い。Segment Anything等の専用モデル優勢の構図を揺るがす。....