浙江大学とアリババが共同でOmniAvatarを発表:音声駆動型全身デジタル人間モデルが登場
浙江大学とアリババが共同で新規な音声駆動モデルであるOmniAvatarを発表し、デジタル人間技術の新たな高みを示した。このモデルは音声を駆動源として、自然で滑らかな全身デジタル人間のビデオを生成することができ、特に歌うシナリオにおいて優れたパフォーマンスを発揮する。口元と音声の唇形が正確に同期しており、効果は非常に迫真である。OmniAvatarはテキストのプロンプトを使って生成の詳細をきめ細かく制御可能で、ユーザーが人物の動きの幅や背景環境、感情表現などをカスタマイズできるため、非常に高い柔軟性を備えている。さらに、このモデルは仮想人物と物体の相互作用を生成できる。