Hace poco, la comunidad de código abierto recibió LLaVA-OneVision-1.5, un nuevo modelo multimodal que marca un avance significativo en la tecnología. La serie LLaVA (Asistente de lenguaje y visión) ha estado en desarrollo durante dos años, evolucionando gradualmente desde un modelo de alineación simple de texto e imagen a un marco integral capaz de procesar varias formas de entrada, como imágenes y videos.
El concepto central de LLaVA-OneVision-1.5 es proporcionar un marco de entrenamiento abierto, eficiente y reproducible, permitiendo a los usuarios construir fácilmente modelos de lenguaje visual de alta calidad. El proceso de entrenamiento se divide en tres etapas: primero, en la etapa de preentrenamiento de alineación entre lenguaje e imagen, el modelo aprende a convertir características visuales en incrustaciones de palabras de lenguaje.

En la segunda etapa, "aprendizaje de conocimiento de alta calidad", el modelo se entrena con 85 millones de muestras de entrenamiento, inyectando una gran cantidad de información visual y de conocimiento, mejorando significativamente las capacidades del modelo. Finalmente, en la etapa de ajuste fino de instrucciones visuales, el modelo se entrena con un conjunto de datos cuidadosamente diseñado, lo que le permite manejar diversas instrucciones visuales complejas.
En cuanto a la eficiencia, el equipo utilizó un método innovador de empaquetado de datos paralelo en línea, mejorando significativamente la eficiencia del entrenamiento. Con 85 millones de muestras, la relación de compresión en el procesamiento de datos alcanzó 11 veces, y el proceso de entrenamiento se completó en solo 3,7 días. Además, LLaVA-OneVision-1.5 utiliza RICE-ViT como codificador visual, teniendo la capacidad de comprender la visión con percepción de región, especialmente adecuado para procesar texto en documentos.

Los datos son la base de las capacidades del modelo, el conjunto de datos de preentrenamiento de LLaVA-OneVision-1.5 es amplio y diverso, e introdujo una estrategia de muestreo "equilibrada en conceptos", asegurando un rendimiento equilibrado del modelo en diversos tipos de tareas. Este modelo mostró un excelente desempeño en diferentes pruebas estándar, especialmente la versión de 8 mil millones de parámetros superó el desempeño de Qwen2.5-VL en 27 pruebas.
Proyecto:
https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5
https://huggingface.co/lmms-lab/LLaVA-OneVision-1.5-8B-Instruct
Destacado:
🌟 LLaVA-OneVision-1.5 es el último modelo multimodal de código abierto, capaz de procesar varios tipos de entrada como imágenes y videos.
📈 El proceso de entrenamiento se divide en tres etapas, con el objetivo de mejorar eficientemente las capacidades de comprensión visual y de lenguaje del modelo.
🏆 LLaVA-OneVision-1.5 mostró un excelente desempeño en pruebas estándar, superando al modelo Qwen2.5-VL.







