Récemment, l'équipe de recherche NVIDIA a lancé le nouveau modèle OmniVinci, un modèle de compréhension multimodal, qui s'est distingué dans plusieurs benchmarks de compréhension multimodal, dépassant les modèles les plus avancés de 19,05 points. Plus impressionnant encore, OmniVinci n'a utilisé que 0,2 billions de tokens d'entraînement pendant son entraînement, soit six fois moins que les 1,2 billions utilisés par les concurrents, ce qui signifie une efficacité des données six fois supérieure.
Le principal objectif d'OmniVinci est de créer un système d'intelligence artificielle capable de comprendre simultanément l'image, le son et le texte, permettant aux machines de percevoir et de comprendre le monde complexe comme l'humain, à travers différents sens. Pour atteindre cet objectif, l'équipe de recherche n'a pas simplement augmenté la quantité de données, mais a réussi à améliorer à la fois les performances et l'efficacité grâce à une architecture réseau innovante et des stratégies de gestion des données.
En termes de conception, OmniVinci utilise le concept d'espace latent multimodal, visant à intégrer les informations provenant de différents sens pour réaliser une compréhension et une inférence transmodales. L'équipe de recherche a découvert que les différents modèles peuvent s'entretenir mutuellement au niveau de la perception et du raisonnement, ce qui ouvre la voie à la construction de systèmes d'IA multimodaux.

L'architecture d'OmniVinci offre une capacité de compréhension transmodale composable, intégrant des entrées hétérogènes telles que des images, des vidéos, des sons et du texte. Grâce à un mécanisme d'alignement multimodal uniforme, le modèle peut intégrer les informations d'encodage provenant de différentes modalités dans un espace latent, puis les introduire dans un grand modèle linguistique (LLM). Ce mécanisme inclut trois technologies clés, dont le module OmniAlignNet qui aligne efficacement les informations visuelles et auditives, tandis que les groupes d'encodage temporel et l'encodage temporel contraint par rotation améliorent la compréhension du modèle en matière d'informations temporelles.
Pour développer les capacités de compréhension multimodale d'OmniVinci, l'équipe de recherche a adopté une méthode d'entraînement en deux étapes. La première étape consiste à l'entraînement spécifique à la modalité, suivie d'une formation conjointe multimodale, utilisant des données d'apprentissage implicite et explicite, ce qui a considérablement amélioré la capacité du modèle à comprendre en synergie.
Avec le lancement d'OmniVinci, NVIDIA démontre à nouveau ses innovations technologiques dans le domaine de l'intelligence artificielle, annonçant que les systèmes d'IA futures seront plus intelligents et plus flexibles.
github : https://github.com/NVlabs/OmniVinci
Points clés :
🌟 Le modèle OmniVinci dépasse les modèles de pointe de 19,05 points dans les tests de benchmark de compréhension multimodale.
📊 La quantité de données d'entraînement n'est qu'un sixième de celle des concurrents, ce qui améliore l'efficacité des données jusqu'à six fois.
🔑 L'utilisation d'une architecture innovante et d'une méthode d'entraînement en deux étapes améliore significativement la capacité du modèle à comprendre les multimodaux.





