京东が世界初のフルスタックリアルタイム動画対話モデル「JoyAI-VL-Interaction」をオープンソース化し、vLLM-Omniの深いサポートを得た。このモデルは従来の受動的応答を打ち破り、AIが能動的に「見ながら話す」ことで、ビジュアルアシスタントが質問待ちから自律的観察と即時インタラクションへ移行したことを示す。....
vLLM-Omniは、テキスト、画像、音声、ビデオの統一生成を実現する初の「全モーダル」推論フレームワークです。解結合パイプラインアーキテクチャを採用し、GitHubからpipで利用可能です。....
vLLM-Omniは、テキスト、画像、音声、動画など多様な入出力をサポートする推論フレームワーク。多モーダル推論を簡素化し、次世代全モーダルモデルを強力に支援します。....