O modelo Etna utiliza a arquitetura Diffusion, combinada com convoluções espaço-temporais e camadas de atenção, permitindo o processamento de dados de vídeo e a compreensão da continuidade temporal, gerando assim conteúdo de vídeo com dimensão temporal. Treinado em um grande conjunto de dados de vídeo, o modelo emprega estratégias de aprendizado profundo, incluindo treinamento em larga escala, otimização de hiperparâmetros e ajuste fino, para garantir desempenho e capacidade de geração robustos.