न्यूडिया अनुसंधान टीम ने आज एक पूर्ण मोडल समझ मॉडल, ओम्निविंस के रूप में जारी किया, जो महत्वपूर्ण पूर्ण मोडल समझ मापदंड पर अद्भुत परिणाम हासिल करता है, जो वर्तमान शीर्ष मॉडल से 19.05 अंक बढ़ गया। अधिक ध्यान आकर्षित करने वाली बात यह है कि ओम्निविंस केवल 1/6 प्रशिक्षण डेटा का उपयोग करता है, जो डेटा दक्षता और प्रदर्शन में उत्कृष्ट दिखाता है।

ओम्निविंस का उद्देश्य एक ऐसा समग्र AI प्रणाली बनाना है जो दृश्य, ध्वनि और पाठ को एक साथ समझ सके, जिससे मशीन मनुष्य की तरह विभिन्न संवेदनाओं के माध्यम से जटिल दुनिया को समझ सके। इस लक्ष्य को प्राप्त करने के लिए, न्यूडिया टीम ने नवाचार आर्किटेक्चर डिज़ाइन और डेटा प्रबंधन रणनीति का उपयोग किया, जो विभिन्न संवेदनाओं के सूचना को एक एकीकृत पूर्ण मोडल स्थान में संयोजित करता है, जिससे पार-मोडल समझ और तार्किक प्रक्रिया होती है।

QQ20251028-113422.png

Dailyomni मापदंड पर, ओम्निविंस Qwen2.5-Omni से बेहतर प्रदर्शन करता है, जो ध्वनि समझ के MMAR परीक्षण में 1.7 अंक बढ़ गया, जबकि दृश्य समझ के Video-MME परीक्षण में 3.9 अंक बढ़ गया। प्रशिक्षण Token केवल 0.2 ट्रिलियन है, जबकि Qwen2.5-Omni के प्रशिक्षण मात्रा 1.2 ट्रिलियन है, जो ओम्निविंस के प्रशिक्षण दक्षता छह गुना बताता है।

इस मॉडल के मुख्य नवाचार पूर्ण मोडल समायोजन तकनीक है, जिसमें OmniAlignNet मॉड्यूल, समय समूह एम्बेडिंग (TEG) और सीमित घूर्णन समय समूह एम्बेडिंग (CRTE) शामिल हैं। OmniAlignNet दृश्य और ध्वनि संकेतों के पूरकता का उपयोग करके, दोनों के अधिक शिक्षा और समायोजन को बल देता है। जबकि TEG दृश्य और ध्वनि सूचना के समय वर्गीकरण के माध्यम से समय संबंधों को दक्षता से संकोड़ता है। CRTE समय समायोजन समस्या को आगे बढ़ाता है, जिससे मॉडल घटनाओं के निरपेक्ष समय सूचना को समझ सकता है।

QQ20251028-113437.png

अनुसंधान टीम ने दो चरण के प्रशिक्षण विधि का उपयोग किया, पहले मोडल विशिष्ट प्रशिक्षण के बाद पूर्ण मोडल संयुक्त प्रशिक्षण के लिए, जो मॉडल के पूर्ण मोडल समझ क्षमता को धीरे-धीरे बढ़ाता है। अस्पष्ट पूर्ण मोडल शिक्षा में, अनुसंधानकर्ता वर्तमान वीडियो प्रश्न-उत्तर डेटासेट के माध्यम से, मॉडल के ध्वनि-छवि संयुक्त समझ क्षमता को आगे बढ़ाते हैं।