Kürzlich hat Meituan offiziell sein neuestes Video-Generationsmodell – LongCat-Video – vorgestellt und macht damit einen wichtigen Schritt im Bereich Künstliche Intelligenz. LongCat-Video zielt darauf ab, AI besser zu helfen, die reale Welt zu verstehen und zu rekonstruieren, und fördert den Fortschritt in der Forschung zu Weltmodellen. Als intelligente System, das physikalische Gesetze und Szenenlogik nachahmen kann, verleiht LongCat-Video AI die Fähigkeit, die Essenz des Funktionierens der Welt zu „sehen“.

Das Modell basiert auf der Architektur Diffusion Transformer (DiT) und kann verschiedene Video-Generationsaufgaben bewältigen, darunter Text-zu-Video, Bild-zu-Video sowie Video-Erweiterung. Sein besonderer Vorteil besteht darin, dass unterschiedliche Generierungsaufgaben keine zusätzlichen Modellanpassungen erfordern und ein vollständiges Aufgabenkreislauf bilden. Zum Beispiel kann Text-zu-Video hochauflösende Videos mit 720p und 30fps generieren, Textanweisungen präzise interpretieren und eine hervorragende semantische Verständnis- und visuelle Darstellungsfähigkeit zeigen. Bild-zu-Video bewahrt streng alle Merkmale des Referenzbildes und stellt sicher, dass der dynamische Prozess physikalischen Gesetzen entspricht. Die Funktion zur Video-Erweiterung ist eines der Kernvorteile von LongCat-Video und kann Videos anhand von mehreren vorhergehenden Bildern fortsetzen, was für die Erstellung langer Videos technisch stark unterstützt.
LongCat-Video verfügt über beeindruckende Fähigkeiten bei der Erstellung langer Videos und kann kontinuierlich Videos bis zu 5 Minuten Länge ausgeben, ohne Qualitätsverlust. Das Modell vermeidet durch fortschrittliche Technologien effektiv Farbverfärbung und Qualitätseinbußen und gewährleistet die zeitliche Konsistenz über mehrere Frames hinweg sowie die physikalische Bewegungsrealismus. Darüber hinaus kombiniert LongCat-Video Block-Sparse-Attention und Bedingungs-Token-Caching-Mechanismen, wodurch die Effizienz bei der Erstellung langer Videos deutlich gesteigert wird und das Problem zwischen Länge und Qualität bei langen Videos gelöst wird.

Bei der Erstellung von Videos mit hoher Auflösung und hoher Bildwiederholungsrate setzt LongCat-Video auf mehrere Optimierungsstrategien, um die Rechengeschwindigkeit zu verbessern und das beste Gleichgewicht zwischen Generationsqualität und Effizienz zu gewährleisten. Das Modell hat strenge interne und öffentliche Benchmarks durchlaufen und zeigt hervorragende allgemeine Leistungsfähigkeit. Die Gesamtleistung erreicht führende水平 im Open-Source-Bereich.
Die Veröffentlichung von LongCat-Video eröffnet Kreatoren eine neue Reise in der Erstellung langer Videos und macht die Videoerstellung einfacher und effizienter.
🌟GitHub:
https://github.com/meituan-longcat/LongCat-Video
🌟Hugging Face:
https://huggingface.co/meituan-longcat/LongCat-Video
🌟Project Page:
https://meituan-longcat.github.io/LongCat-Video/
Zusammenfassung:
🌟 LongCat-Video ist ein Video-Generationsmodell, das von Meituan entwickelt wurde und darauf abzielt, das Verständnis von AI für die echte Welt zu fördern.
🎥 Das Modell unterstützt drei Kerntätigkeiten: Text-zu-Video, Bild-zu-Video und Video-Erweiterung, und ermöglicht die Erstellung von hochwertigen Videos.
⚡ LongCat-Video hat signifikante Vorteile bei der Erstellung längerer Videos und kann stabile Videos mit einer Länge von 5 Minuten ausgeben.



