A equipe de pesquisa da NVIDIA lançou hoje um modelo de compreensão multimodal chamado OmniVinci, que obteve resultados impressionantes nos principais benchmarks de compreensão multimodal, superando os modelos mais avançados em 19,05 pontos. O mais notável é que o OmniVinci usou apenas 1/6 dos dados de treinamento, demonstrando uma eficiência e desempenho excepcionais.

O objetivo do OmniVinci é criar um sistema de IA universal capaz de compreender visual, áudio e texto simultaneamente, permitindo que as máquinas percebam e compreendam o mundo complexo como os humanos. Para alcançar esse objetivo, a equipe da NVIDIA adotou um design inovador de arquitetura e estratégias de gerenciamento de dados, fundindo informações de diferentes sentidos em um espaço potencial multimodal unificado, realizando assim compreensão e raciocínio entre modos.

QQ20251028-113422.png

No benchmark Dailyomni, o desempenho do OmniVinci superou o Qwen2.5-Omni, obtendo 1,7 ponto a mais no teste MMAR de compreensão de áudio e 3,9 ponto a mais no teste Video-MME de compreensão visual. O número de Token de treinamento usado foi apenas 0,2 trilhão, enquanto o Qwen2.5-Omni utilizou 1,2 trilhão, mostrando que a eficiência de treinamento do OmniVinci é seis vezes maior.

A inovação central do modelo está na mecanismo de alinhamento multimodal, incluindo três tecnologias: o módulo OmniAlignNet, a agrupamento de embutimento temporal (TEG) e o embutimento temporal rotacionado com restrições (CRTE). O OmniAlignNet utiliza a complementaridade entre sinais visuais e de áudio, fortalecendo seu aprendizado e alinhamento. O TEG codifica efetivamente as relações temporais ao agrupar informações visuais e de áudio por tempo. O CRTE resolve ainda mais o problema de alinhamento temporal, garantindo que o modelo compreenda informações temporais absolutas dos eventos.

QQ20251028-113437.png

A equipe de pesquisa adotou um método de treinamento em duas etapas, primeiro realizando o treinamento específico de modalidade, seguido pelo treinamento conjunto multimodal para aumentar gradualmente a capacidade de compreensão multimodal do modelo. Em termos de aprendizado multimodal implícito, os pesquisadores melhoraram ainda mais a capacidade do modelo de compreender conjuntamente áudio e vídeo usando conjuntos de dados de perguntas e respostas em vídeo existentes.