VALL-E 2 est un modèle de synthèse vocale lancé par le Microsoft Research Asia. Grâce aux techniques d'échantillonnage perceptif répétitif et de codage par groupe, il améliore considérablement la robustesse et le naturel de la synthèse vocale. Ce modèle est capable de convertir du texte écrit en parole naturelle. Il convient à de nombreux domaines tels que l'éducation, le divertissement et la communication multilingue, jouant un rôle important dans l'amélioration de l'accessibilité et du renforcement des échanges interlinguistiques.