CogVideoX est un modèle open source de génération de vidéos, développé par une équipe de l'Université Tsinghua. Il permet de générer des vidéos à partir de descriptions textuelles. Il propose plusieurs modèles de génération vidéo, allant des modèles basiques aux modèles de grande taille, afin de répondre aux différents besoins en termes de qualité et de coût. Le modèle supporte différentes précisions, notamment FP16 et BF16. Il est recommandé d'utiliser la même précision que celle utilisée lors de l'entraînement du modèle pour l'inférence. Le modèle CogVideoX-5B est particulièrement adapté aux scénarios nécessitant la génération de vidéos de haute qualité, tels que la production cinématographique, le développement de jeux vidéo et la création publicitaire.