Kürzlich hat die Open-Source-Community LLaVA-OneVision-1.5 begrüßt, ein neues multimodales Modell, das eine bedeutende technologische Fortschritt darstellt. Die LLaVA-Serie (Large Language and Vision Assistant) wurde über zwei Jahre entwickelt und ist schrittweise von einem einfachen Bild-Text-Ausrichtungsmodell zu einem umfassenden Framework gewachsen, das Bilder, Videos und andere Eingabeformate verarbeiten kann.
Das Kernprinzip von LLaVA-OneVision-1.5 besteht darin, einen offenen, effizienten und wiedergewinnbaren Trainingsrahmen bereitzustellen, der es Benutzern ermöglicht, hochwertige visuelle Sprachmodelle leicht zu erstellen. Der Trainingsprozess erfolgt in drei Phasen: Zunächst lernt das Modell im Vortrainingsstadium der Bild-Sprache-Ausrichtung, visuelle Merkmale in Sprachwort-Einbettungen umzuwandeln.

Dann, im zweiten Stadium „Hochwertiges Wissenslernen“, wird das Modell auf 85 Millionen Trainingsbeispielen vollständig mit Parametern trainiert, wobei eine große Menge an visuellen und Wissensinformationen eingefügt wird, was die Fähigkeiten des Modells erheblich verbessert. Im dritten Schritt des visuellen Befehls-Feintunings wird das Modell mit einem sorgfältig gestalteten Datensatz trainiert, um die Fähigkeit des Modells zu verfügen, verschiedene komplexe visuelle Befehle zu verarbeiten.
In Bezug auf Effizienz hat das Team eine innovative Methode zur offline parallelen Datenverpackung verwendet, die die Trainings-effizienz erheblich steigerte. Bei 85 Millionen Stichproben beträgt die Datenverarbeitungs-Komprimierungsrate 11-mal, und der Trainingsprozess dauert nur 3,7 Tage. Darüber hinaus verwendet LLaVA-OneVision-1.5 RICE-ViT als visueller Encoder, der über regionale Wahrnehmungsfähigkeiten verfügt und besonders für die Verarbeitung von Text in Dokumenten geeignet ist.

Daten sind die Grundlage der Modellfähigkeiten. Das vortrainierte Datenset von LLaVA-OneVision-1.5 ist vielfältig und beinhaltet eine „Konzeptgleichgewichts“-Abstimmungsstrategie, um sicherzustellen, dass das Modell bei verschiedenen Aufgaben gleichmäßig performt. Das Modell zeigt sich in verschiedenen Benchmarks bemerkenswert, insbesondere die 80 Milliarden Parameter-Version übertreffen die Leistung von Qwen2.5-VL in 27 Benchmarks.
Projekt:
https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5
https://huggingface.co/lmms-lab/LLaVA-OneVision-1.5-8B-Instruct
Wichtige Punkte:
🌟 LLaVA-OneVision-1.5 ist das neueste Open-Source-Multimodal-Modell mit der Fähigkeit, Bilder und Videos sowie andere Eingaben zu verarbeiten.
📈 Der Trainingsprozess erfolgt in drei Phasen, um die visuelle und sprachliche Verständnisfähigkeit des Modells effizient zu verbessern.
🏆 In Benchmark-Tests zeigte LLaVA-OneVision-1.5 hervorragende Ergebnisse und übertraf das Modell Qwen2.5-VL.



