CogVideoX es un modelo de generación de vídeo de código abierto, desarrollado por un equipo de la Universidad Tsinghua, que permite generar vídeos a partir de descripciones textuales. Ofrece varios modelos de generación de vídeo, incluyendo modelos básicos y de gran escala, para satisfacer diferentes necesidades de calidad y coste. El modelo admite varias precisiones, incluyendo FP16 y BF16; se recomienda utilizar la misma precisión que durante el entrenamiento del modelo para la inferencia. El modelo CogVideoX-5B es especialmente adecuado para escenarios que requieren la generación de contenido de vídeo de alta calidad, como la producción cinematográfica, el desarrollo de videojuegos y la creación de anuncios.