Los Modelos de Lenguaje de Difusión Enmascarada (MDLM) son un nuevo tipo de modelo de lenguaje que genera datos de texto de alta calidad mediante mecanismos de enmascaramiento y difusión. MDLM mejora el rendimiento de los modelos de difusión enmascarada mediante métodos de entrenamiento mejorados y una función objetivo simplificada, alcanzando un nuevo estado óptimo en las pruebas de referencia de modelado de lenguaje y aproximándose a la perplejidad de los modelos autorregresivos. Las principales ventajas de MDLM incluyen un muestreador eficiente, la capacidad de generar texto de longitud arbitraria y ventajas en la dependencia a largo plazo y la generación controlable.