हाल ही में, ओपन सोर्स समुदाय में LLaVA-OneVision-1.5 का उद्घाटन हुआ, जो एक नया बहुमाध्यम मॉडल है जो तकनीकी प्रगति के एक महत्वपूर्ण चरण को दर्शाता है। LLaVA (बड़ा भाषा और दृश्य सहायक) श्रृंखला के दो साल के विकास के बाद, इसने सरल छवि-पाठ अनुकूलन मॉडल से छवि, वीडियो आदि के विभिन्न प्रकार के इनपुट के साथ निपटने में सक्षम एक व्यापक फ्रेमवर्क में विकसित हो गया।
LLaVA-OneVision-1.5 के मुख्य विचार एक खुला, दक्ष और पुनरावृत्ति योग्य प्रशिक्षण फ्रेमवर्क प्रदान करना है, जिससे उपयोगकर्ता उच्च गुणवत्ता वाले दृश्य-भाषा मॉडल बनाने में सक्षम हो जाते हैं। इसके प्रशिक्षण प्रक्रिया तीन चरणों में विभाजित है: पहले, भाषा-छवि अनुकूलन प्री-ट्रेनिंग चरण में, मॉडल छवि विशेषताओं को भाषा शब्द एम्बेडिंग में बदलना सीखता है।

अगले दूसरे चरण "उच्च गुणवत्ता ज्ञान सीखना" में, मॉडल 85 मिलियन प्रशिक्षण नमूनों पर पूर्ण पैरामीटर प्रशिक्षण करता है, जिससे बड़ी मात्रा में दृश्य और ज्ञान जानकारी डाली जाती है, जिससे मॉडल क्षमता में वृद्धि होती है। अंत में, दृश्य निर्देश अनुकूलन चरण में, विशेष रूप से डिज़ाइन किए गए डेटा सेट के साथ प्रशिक्षण करके मॉडल कई जटिल दृश्य निर्देशों के साथ निपटने की क्षमता बढ़ जाती है।
कार्यक्षमता के मामले में, टीम ने एक नवाचीन ऑफ़लाइन समानांतर डेटा पैकिंग विधि का उपयोग किया, जिससे प्रशिक्षण कार्यक्षमता में वृद्धि हुई। 85 मिलियन नमूनों के आधार पर, डेटा प्रसंस्करण के दौरान दबाव अनुपात 11 गुना तक पहुंच गया, जिससे प्रशिक्षण प्रक्रिया केवल 3.7 दिन में पूरा हो गया। साथ ही, LLaVA-OneVision-1.5 ने RICE-ViT का उपयोग दृश्य कोडर के रूप में किया, जिसके पास क्षेत्र ज्ञान वाला दृश्य अनुबोधन क्षमता है, जो दस्तावेज में लिखित अक्षरों के साथ विशेष रूप से उपयुक्त है।

डेटा मॉडल क्षमता का आधार है, LLaVA-OneVision-1.5 के प्री-ट्रेनिंग डेटासेट विविध रूप से व्यापक हैं और "अवधारणा संतुलन" के नमूना रणनीति का उपयोग किया गया है, जो मॉडल के विभिन्न कार्यों पर प्रदर्शन को संतुलित रखता है। इस मॉडल ने विभिन्न मानक परीक्षण में उत्कृष्ट प्रदर्शन किया, विशेष रूप से 8 बिलियन पैरामीटर वाले संस्करण ने 27 मानक परीक्षणों में Qwen2.5-VL के प्रदर्शन को पार कर दिया।
परियोजना:
https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5
https://huggingface.co/lmms-lab/LLaVA-OneVision-1.5-8B-Instruct
मुख्य बिंदुओं पर ध्यान दें:
🌟 LLaVA-OneVision-1.5 एक नया ओपन सोर्स बहुमाध्यम मॉडल है, जो छवि और वीडियो आदि के विभिन्न प्रकार के इनपुट के साथ निपटने में सक्षम है।
📈 प्रशिक्षण प्रक्रिया तीन चरणों में विभाजित है, जो मॉडल के दृश्य और भाषा अनुबोधन क्षमता को दक्षता से बढ़ाने के लिए है।
🏆 मानक परीक्षण में, LLaVA-OneVision-1.5 उत्कृष्ट प्रदर्शन करता है, Qwen2.5-VL मॉडल के प्रदर्शन को पार कर देता है।




