In der Forschung zu künstlicher Intelligenz bei Bildbearbeitung und -generierung hat eine neue wegweisende Technologie großes Aufsehen erregt. Das DreamOmni2-System, das von ByteDance in Zusammenarbeit mit der Chinese University of Hong Kong, der Hong Kong University of Science and Technology und der University of Hong Kong entwickelt wurde, ist nun öffentlich zugänglich und markiert die neueste Entwicklung in der Technologie der Bildbearbeitung und -generierung.
Die Einführung von DreamOmni2 zielt darauf ab, die Fähigkeit der künstlichen Intelligenz zur Umsetzung von Anweisungen bei der Bildverarbeitung zu verbessern und eine echte multimodale Anweisungsverstehensfähigkeit zu erreichen. Dieses System kann gleichzeitig Textanweisungen und Referenzbilder verstehen und beseitigt dadurch deutlich die Einschränkungen früherer Modelle beim Umgang mit abstrakten Konzepten wie Stil, Material oder Beleuchtung. Die Interaktion zwischen Nutzer und KI wird natürlicher, als würde man mit einem Partner sprechen, der die eigenen Absichten versteht.

Um die Fähigkeit der KI zu trainieren, komplexe Text- und Bildanweisungen zu verstehen, hat das Entwicklerteam von DreamOmni2 einen innovativen dreistufigen Prozess entwickelt. Zunächst kann die KI durch Training des Extraktionsmodells präzise Elemente oder abstrakte Eigenschaften aus Bildern extrahieren. Danach generiert das Extraktionsmodell multimodale Anweisungsbearbeitungsdaten, um Trainingsbeispiele zu erstellen, die Quellobjekte, Anweisungen, Referenzbilder und Zielbilder enthalten. Schließlich werden durch weiteres Extrahieren und Kombinieren mehr Referenzbilder erzeugt, um ein umfassendes multimodales Anweisungsgenerierungsdatenbank aufzubauen. Diese Schritte legen eine solide Grundlage für die hochwertige Ausbildung des Systems.

In Bezug auf das Modellarchitektur hat DreamOmni2 einen Index-Codierungs- und Position-Codierungs-Verschiebungsplan vorgeschlagen, um sicherzustellen, dass das Modell mehrere Eingabebilder genau erkennen kann. Darüber hinaus wurde ein visuell-sprachliches Modell (VLM) eingeführt, um die Kluft zwischen den Benutzeranweisungen und dem Verständnis des Modells effektiv zu überbrücken. Diese innovative Gestaltung erhöht die Genauigkeit des Systems bei der Bearbeitung von Anweisungen und ermöglicht es, die wahren Absichten der Benutzer besser zu verstehen.
Bei Tests hat DreamOmni2 in Aufgaben der multimodalen Anweisungsbearbeitung die Leistung aller anderen verglichenen Open-Source-Modelle übertroffen und sich den führenden kommerziellen Modellen angenähert. Im Vergleich zu traditionellen kommerziellen Modellen kann DreamOmni2 bei der Bearbeitung komplexer Anweisungen eine höhere Genauigkeit und Konsistenz bieten und unnötige Änderungen sowie Bildfehler vermeiden.



