中科院計算所がStream-Omniマルチモーダル大規模モデルを発表。テキスト・画像・音声の3モーダルに対応し、モーダル間アライメント技術により大規模データ依存を低減。音声とテキストのリアルタイム変換を実現。任意のモーダル組み合わせが可能で、特に画像理解と音声対話に優れる。論文とコードは公開済み。....