Recentemente, a comunidade de código aberto recebeu o LLaVA-OneVision-1.5, um novo modelo multimodal que marca uma grande evolução tecnológica. A série LLaVA (Assistente de Linguagem e Visão) foi desenvolvida por dois anos, evoluindo gradualmente de um modelo simples de alinhamento de imagem e texto para um framework abrangente capaz de lidar com várias formas de entrada, como imagens e vídeos.
O conceito central do LLaVA-OneVision-1.5 é fornecer um framework de treinamento aberto, eficiente e reprodutível, permitindo aos usuários construir facilmente modelos de linguagem visual de alta qualidade. O processo de treinamento é dividido em três etapas: primeiro, na fase de pré-treinamento de alinhamento entre linguagem e imagem, o modelo aprende a transformar características visuais em embeddings de palavras.

Em seguida, na segunda fase "aprendizado de conhecimento de alta qualidade", o modelo é treinado com 85 milhões de amostras, injetando uma grande quantidade de informações visuais e de conhecimento, melhorando significativamente as capacidades do modelo. Por fim, na fase de fine-tuning com instruções visuais, o modelo é treinado com um conjunto de dados bem elaborado, permitindo que ele processe várias tarefas visuais complexas.
Em termos de eficiência, a equipe utilizou um método inovador de empacotamento de dados paralelo offline, aumentando significativamente a eficiência do treinamento. Com base em 85 milhões de amostras, a taxa de compressão no processamento de dados chegou a 11 vezes, e o processo de treinamento foi concluído em apenas 3,7 dias. Além disso, o LLaVA-OneVision-1.5 também utiliza o RICE-ViT como codificador visual, possuindo capacidade de compreensão visual com percepção de região, sendo especialmente adequado para lidar com textos em documentos.

A data é a base das capacidades do modelo. O conjunto de dados de pré-treinamento do LLaVA-OneVision-1.5 é amplo e diversificado, introduzindo uma estratégia de amostragem chamada "equilíbrio de conceitos", garantindo um desempenho equilibrado do modelo em diversos tipos de tarefas. Esse modelo se saiu bem em vários testes de referência, especialmente a versão de 8 bilhões de parâmetros superou o desempenho do Qwen2.5-VL em 27 testes.
Projeto:
https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5
https://huggingface.co/lmms-lab/LLaVA-OneVision-1.5-8B-Instruct
Destaque:
🌟 O LLaVA-OneVision-1.5 é o mais recente modelo multimodal de código aberto, capaz de lidar com várias entradas, como imagens e vídeos.
📈 O processo de treinamento é dividido em três etapas, visando melhorar de forma eficiente as capacidades de compreensão visual e linguística do modelo.
🏆 O LLaVA-OneVision-1.5 apresentou um bom desempenho nos testes de referência, superando o modelo Qwen2.5-VL.







