Recentemente, a DeepMind apresentou um conceito revolucionário em seu último artigo - "cadeia de quadros" (CoF, chain-of-frames), o que marca mais um passo importante no desenvolvimento dos modelos de geração de vídeos. Esse conceito é semelhante ao "pensamento em cadeia" (CoT), que permitiu aos modelos de linguagem realizar raciocínio simbólico, enquanto a "cadeia de quadros" permite que os modelos de vídeo realizem raciocínio temporal e espacial, como se tivessem uma capacidade de pensamento independente.
No artigo, a equipe de pesquisa da DeepMind propôs uma ideia ousada: os modelos de geração de vídeo podem possuir capacidades gerais de compreensão visual, capazes de lidar com diversos tarefas visuais sem treinamento especializado? Atualmente, o campo da visão computacional ainda está na fase tradicional, onde diferentes tarefas exigem diferentes modelos, como segmentação de objetos, detecção de objetos, etc., e sempre que muda a tarefa, é necessário reajustar o modelo.

Para validar essa ideia, a equipe de pesquisa utilizou um método simples e direto: fornecer apenas uma imagem inicial e uma instrução textual ao modelo, para ver se ele consegue gerar um vídeo com resolução de 720p e duração de 8 segundos. Esse método é semelhante à forma como os grandes modelos de linguagem (LLM) realizam tarefas por meio de prompts, com o objetivo de testar a capacidade natural e geral do modelo.
Os resultados mostraram que o modelo Veo3 da DeepMind obteve excelentes desempenhos em vários tarefas clássicas de visão, demonstrando que possui capacidades de percepção, modelagem e manipulação. O mais surpreendente foi que ele se saiu bem ao realizar raciocínio visual transversal no tempo e no espaço, conseguindo planejar uma série de caminhos, permitindo assim resolver problemas visuais complexos.

Em resumo, a equipe da DeepMind resumiu os seguintes três principais resultados:
Adaptabilidade geral forte: o Veo3 é capaz de resolver muitas tarefas que não foram treinadas especificamente, demonstrando uma forte capacidade geral.
Raciocínio visual em formação: analisando os vídeos gerados, o Veo3 mostrou capacidade de raciocínio visual semelhante à "cadeia de quadros", construindo gradualmente uma compreensão do mundo visual.
Tendência de rápido desenvolvimento: apesar de os modelos de tarefas específicas terem melhor desempenho, as capacidades do Veo3 estão aumentando rapidamente, indicando que modelos visuais gerais mais poderosos podem surgir no futuro.
No futuro, a DeepMind acredita que modelos de vídeo gerais podem substituir modelos especializados, assim como o GPT-3 inicial acabou se tornando um modelo base poderoso. À medida que os custos diminuem gradualmente, o uso generalizado dos modelos de geração de vídeos está prestes a acontecer, sinalizando que uma nova era da visão computacional está se aproximando de nós.
Endereço do artigo: https://papers-pdfs.assets.alphaxiv.org/2509.20328v1.pdf







