न्यूडिया अनुसंधान टीम ने आज एक पूर्ण मोडल समझ मॉडल, ओम्निविंस के रूप में जारी किया, जो महत्वपूर्ण पूर्ण मोडल समझ मापदंड पर अद्भुत परिणाम हासिल करता है, जो वर्तमान शीर्ष मॉडल से 19.05 अंक बढ़ गया। अधिक ध्यान आकर्षित करने वाली बात यह है कि ओम्निविंस केवल 1/6 प्रशिक्षण डेटा का उपयोग करता है, जो डेटा दक्षता और प्रदर्शन में उत्कृष्ट दिखाता है।
ओम्निविंस का उद्देश्य एक ऐसा समग्र AI प्रणाली बनाना है जो दृश्य, ध्वनि और पाठ को एक साथ समझ सके, जिससे मशीन मनुष्य की तरह विभिन्न संवेदनाओं के माध्यम से जटिल दुनिया को समझ सके। इस लक्ष्य को प्राप्त करने के लिए, न्यूडिया टीम ने नवाचार आर्किटेक्चर डिज़ाइन और डेटा प्रबंधन रणनीति का उपयोग किया, जो विभिन्न संवेदनाओं के सूचना को एक एकीकृत पूर्ण मोडल स्थान में संयोजित करता है, जिससे पार-मोडल समझ और तार्किक प्रक्रिया होती है।

Dailyomni मापदंड पर, ओम्निविंस Qwen2.5-Omni से बेहतर प्रदर्शन करता है, जो ध्वनि समझ के MMAR परीक्षण में 1.7 अंक बढ़ गया, जबकि दृश्य समझ के Video-MME परीक्षण में 3.9 अंक बढ़ गया। प्रशिक्षण Token केवल 0.2 ट्रिलियन है, जबकि Qwen2.5-Omni के प्रशिक्षण मात्रा 1.2 ट्रिलियन है, जो ओम्निविंस के प्रशिक्षण दक्षता छह गुना बताता है।
इस मॉडल के मुख्य नवाचार पूर्ण मोडल समायोजन तकनीक है, जिसमें OmniAlignNet मॉड्यूल, समय समूह एम्बेडिंग (TEG) और सीमित घूर्णन समय समूह एम्बेडिंग (CRTE) शामिल हैं। OmniAlignNet दृश्य और ध्वनि संकेतों के पूरकता का उपयोग करके, दोनों के अधिक शिक्षा और समायोजन को बल देता है। जबकि TEG दृश्य और ध्वनि सूचना के समय वर्गीकरण के माध्यम से समय संबंधों को दक्षता से संकोड़ता है। CRTE समय समायोजन समस्या को आगे बढ़ाता है, जिससे मॉडल घटनाओं के निरपेक्ष समय सूचना को समझ सकता है।

अनुसंधान टीम ने दो चरण के प्रशिक्षण विधि का उपयोग किया, पहले मोडल विशिष्ट प्रशिक्षण के बाद पूर्ण मोडल संयुक्त प्रशिक्षण के लिए, जो मॉडल के पूर्ण मोडल समझ क्षमता को धीरे-धीरे बढ़ाता है। अस्पष्ट पूर्ण मोडल शिक्षा में, अनुसंधानकर्ता वर्तमान वीडियो प्रश्न-उत्तर डेटासेट के माध्यम से, मॉडल के ध्वनि-छवि संयुक्त समझ क्षमता को आगे बढ़ाते हैं।




