MiniMax H3のビデオ大規模モデルの実装では、複数のフェーズにおける遅延の課題が発生していた。vLLM-Omniアーキテクチャは、完全な常駐パイプラインを介して入力し、長距離シーケンスの注目と通信の最適化、DiT演算子の統合、並列VAEデコードおよびコンパクト出力などのシステムレベルの手法により、エンドツーエンドの遅延を大幅に短縮し、効率的なリアルタイムビデオ生成サービスの新方案を提供する。
Xai
$1.4
入力トークン/百万
$3.5
出力トークン/百万
2k
コンテキスト長
$10.5
256