En el campo de la edición y generación de imágenes con inteligencia artificial, una nueva tecnología revolucionaria ha llamado la atención. El sistema DreamOmni2, desarrollado conjuntamente por ByteDance, la Universidad de Hong Kong en China, la Universidad de Ciencia y Tecnología de Hong Kong y la Universidad de Hong Kong, se ha lanzado de forma abierta, marcando el último avance en la tecnología de edición y generación de imágenes.

El lanzamiento de DreamOmni2 busca mejorar la capacidad de seguimiento de instrucciones de la inteligencia artificial en el procesamiento de imágenes, logrando así una comprensión real de instrucciones multimpodales. Este sistema puede comprender simultáneamente instrucciones de texto y imágenes de referencia, mejorando significativamente las limitaciones de los modelos anteriores al tratar conceptos abstractos (como estilo, material, iluminación). La interacción entre usuarios y la IA es más natural, como si estuvieran conversando con un socio que comprende sus intenciones.

QQ20251027-141041.png

Para entrenar a la IA para comprender instrucciones complejas de texto e imagen, el equipo de desarrollo de DreamOmni2 ha creado un proceso innovador en tres etapas. En primer lugar, mediante el entrenamiento de modelos de extracción, la IA puede extraer con precisión elementos específicos o propiedades abstractas de una imagen. Luego, utilizando el modelo de extracción, se genera datos de edición de instrucciones multimpodales, formando muestras de entrenamiento que incluyen imagen de origen, instrucciones, imagen de referencia y imagen objetivo. Finalmente, mediante una extracción y combinación adicionales, se generan más imágenes de referencia, construyendo así un conjunto de datos de generación de instrucciones multimpodales rico. Estos pasos aseguran una base sólida para el entrenamiento de alta calidad del sistema.

QQ20251027-141058.png

En cuanto a la arquitectura del modelo, DreamOmni2 presentó un esquema de codificación de índices y desplazamiento de codificación de posición, asegurando que el modelo pueda identificar correctamente varias imágenes de entrada. Además, se introdujo un modelo de lenguaje visual (VLM), resolviendo eficazmente la brecha entre las instrucciones del usuario y la comprensión del modelo. Este diseño innovador mejora la precisión del sistema al procesar instrucciones, permitiéndole comprender mejor las intenciones reales del usuario.

Según las pruebas, DreamOmni2 supera a todos los modelos de código abierto comparados en tareas de edición de instrucciones multimpodales, acercándose a los modelos comerciales de élite. En comparación con los modelos comerciales tradicionales, DreamOmni2 puede proporcionar mayor precisión y consistencia al procesar instrucciones complejas, evitando cambios innecesarios y defectos en las imágenes.