Récemment, Meituan a officiellement lancé son nouveau modèle de génération vidéo - LongCat-Video, marquant une importante étape dans le domaine de l'intelligence artificielle. LongCat-Video vise à aider l'IA à mieux comprendre et restructurer le monde réel, favorisant ainsi les recherches sur les modèles du monde. En tant que système intelligent capable de simuler les lois physiques et la logique des scènes, LongCat-Video offre à l'IA la capacité de "voir" les véritables mécanismes du monde.

Ce modèle repose sur une architecture Diffusion Transformer (DiT), capable de traiter diverses tâches de génération vidéo, notamment la génération de vidéos à partir de textes, de vidéos à partir d'images et la continuation de vidéos. Son point unique est que différentes tâches de génération n'ont pas besoin d'adaptation supplémentaire du modèle, formant ainsi un cycle complet de tâche. Par exemple, la génération de vidéos à partir de textes peut produire des vidéos haute définition en 720p, 30 fps, interprétant précisément les instructions textuelles et présentant d'excellentes capacités de compréhension sémantique et de présentation visuelle. La génération de vidéos à partir d'images préserve strictement les caractéristiques de l'image de référence, assurant que le processus dynamique suit les lois physiques. La fonction de continuation de vidéos est l'une des principales forces de LongCat-Video, pouvant continuer une vidéo en se basant sur plusieurs cadres précédents, offrant ainsi un soutien technique puissant pour la génération de longues vidéos.
LongCat-Video dispose d'une excellente capacité à générer des vidéos longues, pouvant produire continuellement des vidéos d'une durée de 5 minutes sans perte de qualité pendant la génération. Le modèle utilise des techniques avancées pour éviter efficacement le décalage des couleurs et la dégradation de la qualité d'image, garantissant l'uniformité temporelle entre les images et la cohérence physique du mouvement. De plus, LongCat-Video intègre également un mécanisme de mémoire de tokens conditionnels et une attention sparse par blocs, améliorant considérablement l'efficacité de la génération de vidéos longues et résolvant ainsi le conflit entre la durée et la qualité des vidéos longues.

Dans la génération de vidéos à haute résolution et à haut taux d'images, LongCat-Video améliore la vitesse de traitement grâce à des stratégies d'optimisation multiples, assurant ainsi un équilibre optimal entre la qualité de génération et l'efficacité. Ce modèle a passé des tests rigoureux internes et publics, montrant des performances exceptionnelles en termes de généralité, atteignant un niveau de compétence supérieur au sein du domaine open source.
Le lancement de LongCat-Video ouvre une nouvelle aventure pour les créateurs dans la création de longues vidéos, rendant la génération de vidéos plus simple et plus efficace.
🌟GitHub:
https://github.com/meituan-longcat/LongCat-Video
🌟Hugging Face:
https://huggingface.co/meituan-longcat/LongCat-Video
🌟Page du projet:
https://meituan-longcat.github.io/LongCat-Video/
Points clés :
🌟 LongCat-Video est un modèle de génération vidéo développé par Meituan, visant à faire progresser la compréhension de l'IA du monde réel.
🎥 Ce modèle prend en charge trois tâches principales : la génération à partir de texte, la génération à partir d'images et la continuation de vidéos, permettant ainsi une génération de vidéos de haute qualité.
⚡ LongCat-Video présente un avantage significatif dans la génération de vidéos longues, pouvant produire de manière stable des vidéos continues de 5 minutes.






