MiniMax H3視頻大模型落地面臨多環節時延挑戰,vLLM-Omni架構以完整常駐流水線切入,通過長序列注意力與通信優化、融合DiT算子、並行VAE解碼及緊湊輸出等系統級手段,大幅壓縮端到端時延,爲高效實時視頻生成服務提供新方案。
Xai
$1.4
輸入tokens/百萬
$3.5
輸出tokens/百萬
2k
上下文長度
$10.5
256