Los modelos de difusión continua para lenguaje vuelven con fuerza
Continuous Diffusion Language Models (CDLM's)

Tras años de dominio de la difusión discreta, los modelos de difusión continua para lenguaje (CDLM) están experimentando un renacimiento. Este artículo repasa la historia de esta aproximación, desde los primeros intentos en 2021 hasta su aparente extinción en 2023, y analiza las razones de su regreso. Se discuten aspectos técnicos clave como las estrategias de embedding, la función de pérdida y el autoconficionamiento, y se examina por qué la difusión continua podría ofrecer ventajas como la representación de incertidumbre a nivel de token y un arsenal de algoritmos de muestreo. El autor, con experiencia en modelos de difusión para imagen y video, ofrece una perspectiva personal y subjetiva sobre este cambio de tendencia.
La eficiencia de entrenamiento era casi dos órdenes de magnitud peor que la de una línea base autorregresiva, lo que hacía difícil tomarse en serio cualquier enfoque de modelado.
- janalsncm
> [en 2020/2021] el dominio de la autoregresión no estaba tan establecido como hoy: GPT-3 había llamado la atención, pero el 'momento ChatGPT' no llegaría hasta finales de 2022
No estoy de acuerdo con esto. Los decoders eran absolutamente dominantes en 2020 para el chat. GPT-2 se consideraba demasiado peligroso para publicarlo, y recuerdo afanarme por entrar en la lista de espera de GPT-3. Funcionó.
(La única excepción que haré son los modelos encoder-decoder, que ahora a menudo se hacen solo con decoder).
Pero lo que lo hizo mainstream fue el RL. RLHF al principio, luego otras mejoras como DPO que eran menos dolorosas de configurar. Añadir difusión encima sería un dolor de cabeza aún mayor.
Antes de ChatGPT realmente no había mucho concepto de pre-entrenamiento y post-entrenamiento. Era todo pre-entrenamiento. El post-entrenamiento fue lo que hizo que los bots fueran conversacionales y no solo 'continuar lo que les escribías'.
En resumen, la difusión nunca despegó porque era solo una forma más complicada de generar tokens, y el problema real era conseguir tokens en la distribución correcta.
- 2001zhaozhao
Me encantaría ver modelos que puedan pensar a diferentes ritmos y también generar un borrador de pensamiento junto con el texto de salida, en lugar de antes de toda la salida.
Ahora los modelos necesitan depender de un CoT comprimido menos legible para obtener alta inteligencia por token/paso, pero con difusión solo necesitarían generar más tokens por paso.
- p1esk
Es refrescante leer algo que no esté generado por IA.
- vatsachak
Siento que todavía hay fruta madura en los LLM autorregresivos; el encoder
- Marchant_hq
Los CDLM parecen prometedores para una generación de texto más fluida y coherente. Emocionado de ver cómo abordan las discontinuidades a nivel de token.