Há pouco tempo, o Meituan lançou oficialmente seu novo modelo de geração de vídeos — LongCat-Video, marcando um importante passo em direção à área de inteligência artificial. O LongCat-Video tem como objetivo ajudar a IA a compreender melhor e reestruturar o mundo real, promovendo o avanço da pesquisa sobre modelos do mundo. Como um sistema inteligente capaz de simular leis físicas e lógica de cenários, o LongCat-Video fornece à IA a capacidade de "ver" a essência do funcionamento do mundo.

image.png

O modelo é baseado na arquitetura Diffusion Transformer (DiT), capaz de lidar com várias tarefas de geração de vídeos, incluindo geração de vídeo a partir de texto, geração de vídeo a partir de imagem e continuação de vídeo. Sua característica única é que diferentes tarefas de geração não exigem adaptação adicional do modelo, formando um ciclo completo de tarefas. Por exemplo, a geração de vídeo a partir de texto pode produzir vídeos em alta definição de 720p, 30fps, interpretando com precisão as instruções de texto e demonstrando excelentes habilidades de compreensão semântica e apresentação visual. A geração de vídeo a partir de imagem mantém rigorosamente as características da imagem de referência, garantindo que o processo dinâmico obedeça às leis físicas. A função de continuação de vídeo é uma das principais vantagens do LongCat-Video, podendo continuar o vídeo com base no conteúdo de múltiplas frames anteriores, fornecendo suporte técnico poderoso para a geração de vídeos longos.

O LongCat-Video possui uma excelente capacidade de geração de vídeos longos, podendo produzir continuamente vídeos de até 5 minutos, sem perder qualidade durante a geração. O modelo utiliza meios tecnológicos avançados para evitar efetivamente descoloração de cores e degradação da qualidade da imagem, garantindo consistência temporal entre os quadros e racionalidade do movimento físico. Além disso, o LongCat-Video combina mecanismos de atenção esparsa por blocos e cache de tokens condicionais, aumentando significativamente a eficiência da geração de vídeos longos, resolvendo assim o conflito entre duração e qualidade nos vídeos longos.

image.png

Na geração de vídeos de alta resolução e alta taxa de quadros, o LongCat-Video, por meio de estratégias de otimização múltiplas, melhora a velocidade de raciocínio, garantindo o equilíbrio ideal entre qualidade e eficiência da geração. O modelo passou por testes rigorosos internos e públicos, demonstrando desempenho excepcional, com capacidades gerais que atingem níveis líderes no setor de código aberto.

O lançamento do LongCat-Video abre uma nova jornada para criadores na criação de vídeos longos, tornando a geração de vídeos mais simples e eficiente.

🌟GitHub:

https://github.com/meituan-longcat/LongCat-Video

🌟Hugging Face:

https://huggingface.co/meituan-longcat/LongCat-Video

🌟Página do Projeto:

https://meituan-longcat.github.io/LongCat-Video/

Principais pontos:  

🌟 O LongCat-Video é um modelo de geração de vídeos desenvolvido pelo Meituan, com o objetivo de promover a compreensão da IA sobre o mundo real.  

🎥 O modelo suporta três tarefas principais: geração de vídeo a partir de texto, geração de vídeo a partir de imagem e continuação de vídeo, realizando a geração de vídeos de alta qualidade.  

⚡ O LongCat-Video possui vantagens significativas na geração de vídeos longos, podendo produzir vídeos contínuos de 5 minutos de forma estável.