Kürzlich hat das Forschungsteam von NVIDIA eine neue OmniVinci-Modell zur multimodalen Verständnis veröffentlicht. Das Modell zeigte sich in mehreren Benchmark-Tests für multimodale Verständnis, wobei es die führenden Modelle um 19,05 Punkte übertraf. Noch beeindruckender ist, dass OmniVinci während des Trainings nur 0,2 Billionen Trainings-Token verwendet hat, was sechs Mal effizienter ist als die 1,2 Billionen Token der Konkurrenz.

Das zentrale Ziel von OmniVinci besteht darin, ein künstliches Intelligenzsystem zu schaffen, das visuelle, akustische und textuelle Informationen gleichzeitig versteht, sodass Maschinen die komplexe Welt wie Menschen durch verschiedene Sinne wahrnehmen und verstehen können. Um dieses Ziel zu erreichen, erhöhte das Forschungsteam nicht einfach die Datenmenge, sondern erreichte durch innovative Netzwerkarchitekturen und Datenverwaltungsstrategien eine Doppelsteigerung von Leistung und Effizienz.

Im Design verwendet OmniVinci den Konzept der vollständigen multimodalen latenten Raum, um Informationen aus verschiedenen Sinnen zu integrieren und übermodale Verständnis und Schlussfolgerung zu ermöglichen. Das Forschungsteam entdeckte, dass verschiedene Modi sich auf der Ebene der Wahrnehmung und Schlussfolgerung gegenseitig stärken, was den Weg für die Entwicklung von multimodalen AI-Systemen weist.

image.png

Die Architektur von OmniVinci verfügt über kombinierbare, übermodale Verständnisfähigkeiten und integriert heterogene Eingaben wie Bilder, Videos, Audios und Texte. Durch eine einheitliche, vollständige multimodale Ausrichtungsmechanismus kann das Modell die eingebetteten Informationen verschiedener Modi in einen latenten Raum integrieren und dann in ein großes Sprachmodell (LLM) weiterleiten. Dieser Mechanismus beinhaltet drei Schlüsseltechnologien, wobei der OmniAlignNet-Modul effektiv visuelle und akustische Informationen ausrichtet, während zeitliche Einbettungsgruppen und eingeschränkte zeitliche Einbettungen die Fähigkeit des Modells, Zeitinformationen zu verstehen, verbessern.

Um die multimodale Verständnisfähigkeit von OmniVinci zu fördern, verwendete das Forschungsteam einen zweistufigen Trainingsansatz. Zuerst erfolgte der modusbezogene Training, gefolgt vom vollständigen multimodalen gemeinsamen Training, wobei implizite und explizite Lerndaten genutzt wurden, um die gemeinsame Verständnisfähigkeit des Modells erheblich zu steigern.

Mit der Veröffentlichung von OmniVinci zeigt NVIDIA erneut seine technologischen Innovationen im Bereich Künstliche Intelligenz und deutet an, dass zukünftige AI-Systeme noch intelligenter und flexibler sein werden.

github: https://github.com/NVlabs/OmniVinci

Wichtige Punkte:

🌟 Das OmniVinci-Modell übertrifft bei Benchmarks für multimodales Verständnis die führenden Modelle um 19,05 Punkte.  

📊 Die Trainingsdatenmenge beträgt nur ein Sechstel der Konkurrenz, wodurch die Daten-effizienz sechsfach gestiegen ist.  

🔑 Es wird eine innovative Architektur und ein zweistufiger Trainingsansatz verwendet, um die multimodale Verständnisfähigkeit des Modells erheblich zu steigern.