हाल ही में, मेट ने अपने सबसे नए वीडियो जनरेशन मॉडल - LongCat-Video का आधिकारिक रूप से अनावरण किया, जो कि कृत्रिम बुद्धिमत्ता के क्षेत्र में एक महत्वपूर्ण कदम है। LongCat-Video AI के वास्तविक दुनिया के बारे में बेहतर समझ और पुनः निर्माण में सहायता करने के लिए डिज़ाइन किया गया है और विश्व मॉडल के अनुसंधान के विकास में योगदान देता है। भौतिक नियमों और स्थिति तार्किकता के मॉडलिंग के सक्षम सिस्टम के रूप में, LongCat-Video AI के लिए "दुनिया के काम करने के तत्वों" को देखने की क्षमता प्रदान करता है।

यह मॉडल Diffusion Transformer (DiT) आर्किटेक्चर पर आधारित है, जो विभिन्न वीडियो जनरेशन कार्य को संभाल सकता है, जैसे टेक्स्ट से वीडियो बनाना, छवि से वीडियो बनाना और वीडियो के आगे बढ़ाना। इसकी विशिष्टता यह है कि अलग-अलग जनरेशन कार्य के लिए कोई अतिरिक्त मॉडल अनुकूलन की आवश्यकता नहीं होती है, जो एक पूर्ण कार्य बंद करता है। उदाहरण के लिए, टेक्स्ट से वीडियो बनाना 720p, 30fps के उच्च गुणवत्ता वाले वीडियो बना सकता है, टेक्स्ट निर्देशों के सटीक विश्लेषण के साथ अच्छी अर्थपूर्ण समझ और दृश्य प्रस्तुति क्षमता प्रदर्शित करता है। छवि से वीडियो बनाना संदर्भ छवि की सभी विशेषताओं को सख्ती से बरकरार रखता है, और गतिशील प्रक्रिया भौतिक नियमों के अनुरूप होती है। वीडियो के आगे बढ़ाना क्षमता LongCat-Video के मुख्य फायदों में से एक है, जो कि बहुत से फ्रेम पहले के सामग्री के आधार पर वीडियो को आगे बढ़ा सकता है और लंबे वीडियो जनरेशन के लिए एक शक्तिशाली तकनीकी समर्थन प्रदान करता है।
LongCat-Video लंबे वीडियो जनरेशन क्षमता में अद्भुत है, जो 5 मिनट तक लगातार वीडियो उत्पादन कर सकता है, और जनरेशन प्रक्रिया के दौरान कोई गुणवत्ता हानि नहीं होती है। मॉडल उन्नत तकनीकी उपायों के माध्यम से, रंग ड्रिफ्ट और गुणवत्ता के घटाव को प्रभावी ढंग से रोकता है, जो कि फ्रेम-से-फ्रेम समय संगतता और भौतिक गति की तार्किकता को सुनिश्चित करता है। इसके अलावा, LongCat-Video ब्लॉक-स्पार्स एटेंशन और शर्त टोकन कैश मेकेनिज्म के साथ जुड़ा हुआ है, जो लंबे वीडियो जनरेशन की दक्षता में बड़ा वृद्धि करता है और इस प्रकार लंबे वीडियो जनरेशन में लंबाई और गुणवत्ता के बीच के विरोध को हल करता है।

उच्च रिज़ॉल्यूशन और उच्च फ्रेम दर वाले वीडियो जनरेशन में, LongCat-Video अनेक अनुकूलन रणनीतियों के माध्यम से तर्क की गति में सुधार करता है, जो जनरेशन गुणवत्ता और दक्षता के बीच अद्वितीय संतुलन सुनिश्चित करता है। इस मॉडल का आंतरिक और सार्वजनिक मानक परीक्षण के माध्यम से बहुत अच्छा प्रदर्शन किया गया है, जो ओपन सोर्स क्षेत्र में अग्रणी स्थिति में एक व्यापक क्षमता प्रदर्शित करता है।
LongCat-Video के जारी करने से रचनाकारों के लिए लंबे वीडियो बनाने की एक नई यात्रा खोल दी गई है, जो वीडियो जनरेशन को अधिक सरल और कुशल बना देता है।
🌟GitHub:
https://github.com/meituan-longcat/LongCat-Video
🌟Hugging Face:
https://huggingface.co/meituan-longcat/LongCat-Video
🌟Project Page:
https://meituan-longcat.github.io/LongCat-Video/
मुख्य बिंदुओं पर ध्यान दें:
🌟 LongCat-Video मेट द्वारा एक वीडियो जनरेशन मॉडल है, जो कृत्रिम बुद्धिमत्ता के वास्तविक दुनिया के बारे में समझ के विकास में योगदान देने के लिए डिज़ाइन किया गया है।
🎥 यह मॉडल टेक्स्ट से वीडियो बनाना, छवि से वीडियो बनाना और वीडियो के आगे बढ़ाना तीन मुख्य कार्यों का समर्थन करता है और उच्च गुणवत्ता वाले वीडियो जनरेशन को संभव बनाता है।
⚡ LongCat-Video लंबे वीडियो जनरेशन में उल्लेखनीय लाभ है, जो 5 मिनट के लगातार वीडियो उत्पादन के लिए स्थिर रहता है।




