हाल ही में, डीपमाइंड ने अपने नए पेपर में एक उलटा अवधारणा - "फ्रेम चेन" (CoF, फ्रेम्स की श्रृंखला) प्रस्तुत किया, जो वीडियो जनरेशन मॉडल के विकास में एक महत्वपूर्ण चरण है। यह अवधारणा पहले के "चेन ऑफ थॉट्स" (CoT) के समान है, जो भाषा मॉडल को संकेत अनुमान करने में सक्षम बनाता है, जबकि "फ्रेम चेन" वीडियो मॉडल को समय और अंतरिक्ष में अनुमान करने में सक्षम बनाता है, जैसे वीडियो जनरेशन मॉडल को एक स्वतंत्र सोच क्षमता प्रदान करता है।

पेपर में, डीपमाइंड के अनुसंधान टीम ने एक हासिल विचार प्रस्तुत किया: क्या वीडियो जनरेशन मॉडल वर्तमान बड़े भाषा मॉडल (LLM) की तरह एक सामान्य दृश्य समझ क्षमता रख सकता है, जो विभिन्न दृश्य कार्यों को विशेष रूप से प्रशिक्षित बिना संभाल सकता है? वर्तमान में, मशीन दृश्य क्षेत्र में पारंपरिक चरण में है, जहां विभिन्न कार्यों के लिए अलग-अलग मॉडल की आवश्यकता होती है, जैसे वस्तु विभाजन, वस्तु निर्धारण आदि, प्रत्येक बार कार्य बदलने पर मॉडल को पुनः समायोजित करना पड़ता है।

image.png

इस विचार की पुष्टि करने के लिए, अनुसंधान टीम ने एक सरल और क्रूर तरीका अपनाया: मॉडल को केवल एक शुरुआती छवि और एक लिखित निर्देश प्रदान करें, देखें क्या यह 720p रिज़ॉल्यूशन और 8 सेकंड की अवधि वाला एक वीडियो जनरेट कर सकता है। यह विधि बड़े भाषा मॉडल द्वारा कार्य के लिए प्रेरणा के समान है, जिसका उद्देश्य मॉडल की मूल सामान्य क्षमता का परीक्षण करना है।

परिणाम दर्शाते हैं कि डीपमाइंड के वीओई3 मॉडल विभिन्न पारंपरिक दृश्य कार्यों में अच्छा प्रदर्शन करता है, जो इसके अंतर्दृष्टि क्षमता, मॉडलिंग क्षमता और नियंत्रण क्षमता को दर्शाता है। अधिक आश्चर्य की बात यह है कि यह अंतर-समय और अंतर-अंतरिक्ष दृश्य अनुमान में अच्छा प्रदर्शन करता है, जो कई पथों की योजना बनाने में सक्षम होता है, जिससे जटिल दृश्य समस्याओं का समाधान होता है।

image.png

समग्र रूप से, डीपमाइंड टीम ने निम्नलिखित तीन मुख्य निष्कर्ष साझा किए:

सामान्य अनुकूलन क्षमता: वीओई3 कई अनुप्रयोग के लिए विशेष रूप से प्रशिक्षित कार्यों को हल कर सकता है, जो एक मजबूत सामान्य क्षमता को दर्शाता है।

दृश्य अनुमान के प्रारंभिक चिह्न: जनरेट किए गए वीडियो के विश्लेषण के माध्यम से, वीओई3 दृश्य अनुमान क्षमता के समान "फ्रेम चेन" को दर्शाता है, जो धीरे-धीरे दृश्य दुनिया के बारे में समझ बनाता है।

तेजी से विकास की घटना: यद्यपि विशिष्ट कार्य मॉडल अधिक अच्छा प्रदर्शन करते हैं, वीओई3 क्षमता तेजी से बढ़ रही है, जो भविष्य में अधिक मजबूत सामान्य दृश्य मॉडल के आगमन की ओर इशारा करती है।

भविष्य में, डीपमाइंड के अनुसार, सामान्य वीडियो मॉडल विशेष अवसरों के मॉडल को स्थान दे सकते हैं, जैसे कि प्रारंभिक GPT-3 अंततः शक्तिशाली आधार मॉडल बन गया। लागत के क्रमिक कम होने के साथ, वीडियो जनरेशन मॉडल के व्यापक उपयोग के निकट भविष्य की ओर इशारा करता है, जो मशीन दृश्य के एक नए युग के आगमन की ओर इशारा करता है।

पेपर का पता: https://papers-pdfs.assets.alphaxiv.org/2509.20328v1.pdf