Recientemente, el equipo de investigación de IA de Alibaba ha logrado un progreso notable en el campo de la comprensión de documentos. Han lanzado mPLUG-DocOwl1.5, un modelo de vanguardia que demuestra un rendimiento excepcional en tareas de comprensión de documentos sin OCR (reconocimiento óptico de caracteres).

image.png

Anteriormente, para procesar tareas de comprensión de documentos, solíamos depender de la tecnología OCR para extraer texto de imágenes. Sin embargo, esto a menudo se veía afectado por diseños complejos y ruido visual. mPLUG-DocOwl1.5, por el contrario, utiliza un nuevo marco de aprendizaje de estructura unificada para aprender a comprender documentos directamente de imágenes, evitando ingeniosamente este cuello de botella.

Este modelo analiza la capacidad de diseño y organización de documentos en diferentes campos, abarcando cinco áreas: documentos comunes, tablas, gráficos, páginas web e imágenes naturales. No solo identifica con precisión el texto, sino que también utiliza elementos como espacios y saltos de línea para comprender la estructura del documento.

image.png

Para las tablas, el modelo puede generar un formato Markdown estructurado, mientras que al analizar gráficos, transforma la información en una tabla de datos al comprender la relación entre las leyendas, los ejes de coordenadas y los valores numéricos. Además, mPLUG-DocOwl1.5 también tiene la capacidad de extraer texto de imágenes naturales.

En cuanto a la localización de texto, mPLUG-DocOwl1.5 puede identificar y localizar palabras, frases, líneas y bloques, asegurando una alineación precisa entre el texto y las áreas de la imagen. Su arquitectura H-Reducer, por otro lado, fusiona horizontalmente las características visuales mediante operaciones de convolución, manteniendo el diseño espacial al tiempo que reduce la longitud de la secuencia, lo que mejora la eficiencia del procesamiento.

Para entrenar este modelo, el equipo de investigación utilizó dos conjuntos de datos cuidadosamente seleccionados. DocStruct4M es un conjunto de datos a gran escala que se centra en el aprendizaje de estructuras unificadas, mientras que DocReason25K prueba la capacidad de razonamiento del modelo mediante preguntas y respuestas paso a paso.

Los resultados muestran que mPLUG-DocOwl1.5 ha establecido nuevos récords en diez pruebas de referencia, superando a modelos similares en más de 10 puntos en la mitad de las tareas. Además, demuestra una excelente capacidad de razonamiento lingüístico, pudiendo generar explicaciones detalladas paso a paso para sus respuestas.

A pesar de los notables avances de mPLUG-DocOwl1.5 en varios aspectos, los investigadores reconocen que aún hay margen de mejora, especialmente en el manejo de afirmaciones inconsistentes o erróneas. En el futuro, el equipo espera ampliar aún más el marco de aprendizaje de estructuras unificadas para abarcar más tipos de documentos y tareas, impulsando así el desarrollo de la IA para documentos.

Artículo: https://arxiv.org/abs/2403.12895

Código: https://github.com/X-PLUG/mPLUG-DocOwl/tree/main/DocOwl1.5

Puntos clave:

📄 mPLUG-DocOwl1.5 es un modelo de IA que destaca en tareas de comprensión de documentos sin necesidad de OCR.

🔍 Este modelo puede analizar el diseño de documentos, abarca varios tipos de documentos y puede aprender a comprender directamente de las imágenes.

📈 mPLUG-DocOwl1.5 ha establecido nuevos récords en diez pruebas de referencia y demuestra una excelente capacidad de razonamiento lingüístico.