Recentemente, a equipe de pesquisa da NVIDIA lançou o novo modelo OmniVinci, um modelo de compreensão multimodal, que se destacou em vários benchmarks de compreensão multimodal, superando os modelos mais avançados atuais em 19,05 pontos. O mais impressionante é que o OmniVinci utilizou apenas 0,2 trilhão de tokens de treinamento durante o processo de treinamento, seis vezes menos do que os concorrentes, que usaram 1,2 trilhão de tokens, tornando sua eficiência de dados seis vezes maior.

O objetivo principal do OmniVinci é criar um sistema de inteligência artificial capaz de compreender visual, áudio e texto simultaneamente, permitindo que as máquinas percebam e compreendam o mundo complexo como humanos, por meio de diferentes sentidos. Para alcançar esse objetivo, a equipe de pesquisa não se limitou simplesmente a aumentar a quantidade de dados, mas sim, através de arquiteturas inovadoras de rede e estratégias de gestão de dados, conseguiu melhorar significativamente o desempenho e a eficiência.

No design, o OmniVinci adota o conceito de espaço latente multimodal, visando integrar informações provenientes de diferentes sentidos, para realizar compreensão e raciocínio entre modos. A equipe de pesquisa descobriu que diferentes modos podem se reforçar mutuamente no nível de percepção e raciocínio, uma descoberta que aponta o caminho para a construção de sistemas de IA multimodal.

image.png

A arquitetura do OmniVinci possui capacidade de compreensão cruzada multimodal componível, integrando entradas heterogêneas como imagens, vídeos, áudios e textos. Por meio de um mecanismo unificado de alinhamento multimodal, o modelo pode integrar informações de embutimento de diferentes modos em um espaço latente, que posteriormente são inseridas em um modelo de linguagem grande (LLM). Esse mecanismo inclui três tecnologias-chave, onde o módulo OmniAlignNet alinha efetivamente informações visuais e de áudio, enquanto a agrupamento de embutimentos temporais e a embutimento temporal com restrições melhoram a compreensão do modelo sobre informações temporais.

Para desenvolver a capacidade de compreensão multimodal do OmniVinci, a equipe de pesquisa adotou um método de treinamento em duas etapas. Primeiro, o treinamento específico de modo, seguido pelo treinamento conjunto multimodal, utilizando dados de aprendizado implícito e explícito, melhorando significativamente a capacidade de compreensão conjunta do modelo.

Com o lançamento do OmniVinci, a NVIDIA novamente demonstra sua inovação tecnológica na área de inteligência artificial, indicando que os sistemas de IA do futuro serão mais inteligentes e flexíveis.

github: https://github.com/NVlabs/OmniVinci

Principais pontos:

🌟 O modelo OmniVinci superou os modelos de ponta em 19,05 pontos nos testes de benchmark de compreensão multimodal.  

📊 O volume de dados de treinamento é apenas 1/6 do concorrente, aumentando a eficiência dos dados em seis vezes.  

🔑 Utiliza uma arquitetura inovadora e um método de treinamento em duas etapas, melhorando significativamente a capacidade de compreensão multimodal do modelo.