कृत्रिम बुद्धिमत्ता छवि संपादन एवं जनरेशन के क्षेत्र में, एक नई क्रांतिकारी तकनीक लोगों का ध्यान आकर्षित कर रही है। बाइटडांस और हांगकांग चाइनीज यूनिवर्सिटी, हांगकांग साइंस एंड टेक्नोलॉजी यूनिवर्सिटी और हांगकांग यूनिवर्सिटी के साथ मिलकर विकसित किए गए DreamOmni2 प्रणाली, आधिकारिक रूप से ओपन सोर्स कर दिया गया है, जो छवि संपादन एवं जनरेशन तकनीक के अब तक के सबसे नए विकास को चिह्नित करता है।

DreamOmni2 के लॉन्च के साथ, यह छवि प्रोसेसिंग में निर्देश पालन क्षमता को बढ़ाने के लिए डिज़ाइन किया गया है, जो वास्तविक बहु-माध्यम निर्देश समझ को साकार करता है। यह प्रणाली टेक्स्ट निर्देश और संदर्भ छवि दोनों को समझ सकती है, जो अब तक के मॉडल के काफी अभिव्यक्ति अवधारणाओं (जैसे शैली, सामग्री, प्रकाश) के साथ निपटने में बाधा के अंतर को ध्यान में रखता है। उपयोगकर्ता एवं AI के बीच अधिक प्राकृतिक अंतरक्रिया होती है, जैसे एक ऐसे साझेदार के साथ बात कर रहे हों जो आपके इरादे को समझता है।

QQ20251027-141041.png

कृत्रिम बुद्धिमत्ता के जटिल टेक्स्ट एवं छवि निर्देशों के अर्थ समझने के लिए, DreamOmni2 के विकास टीम ने एक नवाचीन तीन चरणीय प्रक्रिया विकसित की। पहले, एक अतिरिक्त मॉडल के माध्यम से, AI छवि में विशिष्ट तत्वों या अमूर्त गुणों को ठीक से अतिरिक्त कर सकता है। दूसरे, अतिरिक्त मॉडल का उपयोग करके बहु-माध्यम निर्देश संपादन डेटा बनाया जाता है, जिसमें स्रोत छवि, निर्देश, संदर्भ छवि और लक्ष्य छवि शामिल होती है। अंत में, अतिरिक्त और संयोजन के माध्यम से अधिक संदर्भ छवि बनाई जाती है, जिससे बहु-माध्यम निर्देश जनरेशन डेटा सेट का निर्माण होता है। इन सभी चरणों ने प्रणाली के उच्च गुणवत्ता शिक्षा के लिए एक मजबूत आधार डाला।

QQ20251027-141058.png

मॉडल वास्तुकला के अंतर्गत, DreamOmni2 ने सूचकांक कोडिंग और स्थान कोडिंग विचलन योजना प्रस्तुत की, जो मॉडल को बहुत सारी इनपुट छवियों की पहचान करने में सक्षम बनाती है। इसके अलावा, विजुअल लैंग्वेज मॉडल (VLM) के प्रयोग से, उपयोगकर्ता के निर्देश और मॉडल के अर्थ के बीच के अंतर को प्रभावी ढंग से हल किया गया है। इस नवाचीन डिज़ाइन ने प्रणाली के निर्देश संसाधन में सटीकता में सुधार किया है, जिससे यह उपयोगकर्ता के वास्तविक इरादे को बेहतर समझ सकता है।

परीक्षण के दौरान, DreamOmni2 बहु-माध्यम निर्देश संपादन कार्यों में तुलना में भाग ले रहे सभी ओपन सोर्स मॉडलों से बेहतर प्रदर्शन करता है, शीर्ष वाणिज्यिक मॉडल के करीब हो जाता है। आम वाणिज्यिक मॉडलों की तुलना में, DreamOmni2 जटिल निर्देशों के साथ निपटने में अधिक सटीकता और संगतता प्रदान करता है, अवांछित परिवर्तनों और छवि दोषों से बचता है।

DreamOmni2 के ओपन सोर्स होने से, एआई रचनात्मकता के लिए नए संभावनाओं की पेशकश की जाती है और आसन्न क्षेत्र के अनुसंधानकर्ताओं के लिए एक एकीकृत मूल्यांकन मानक प्रदान करता है। इस तकनीक के उद्घाटन के साथ, एआई छवि संपादन एवं जनरेशन के क्षेत्र में नई क्रांति की भविष्यवाणी की जाती है। भविष्य के विकास के बारे में उद्योग विशेषज्ञों का कहना है कि DreamOmni2 की सफलता एआई तकनीक के व्यापक उपयोग और अपनाने को बहुत अधिक बढ़ाएगी।