Difusión para lenguaje: cómo construir un modelo de lenguaje por difusión
How to build a diffusion language model

Los modelos de lenguaje autorregresivos generan texto token a token, sin posibilidad de corregir errores y con generación lenta. La difusión enmascarada ofrece una alternativa: genera la secuencia completa de una vez, refinándola iterativamente, lo que permite corrección de errores, generación paralela y atención bidireccional. Este artículo explica los fundamentos de la difusión enmascarada, su perspectiva probabilística, la difusión por bloques para longitud flexible, arquitecturas, refinamiento iterativo, destilación para acelerar el muestreo, generación controlable, post-entrenamiento, aplicaciones en biología y ciencia, y su escalamiento en grandes modelos de lenguaje, con ejemplos como Mercury 2, Gemma Diffusion y Nemotron Diffusion.
Cada ronda deja menos posiciones enmascaradas, hasta que la secuencia converge a una muestra limpia del modelo.