告别自回归:构建扩散语言模型指南
How to build a diffusion language model

主流语言模型长期依赖自回归架构,逐字生成导致无法纠错且速度受限。扩散模型为文本生成带来新范式:从全掩码序列出发,通过多轮迭代并行填充与去噪,实现双向上下文感知与错误修正。2024 年扩散模型质量已追平自回归模型,2026 年 Mercury 2、Gemma Diffusion 和 Nemotron Diffusion 等工业级产品相继问世。本文深入解析 Masked Diffusion 原理,从概率视角拆解前向掩码与反向去噪过程,探讨 Block Diffusion 在灵活长度生成中的应用,并揭示蒸馏加速、可控生成及生物科学领域的创新实践,展现扩散模型如何重塑大语言模型的未来。
你可以将 Masked Diffusion 视为一种生成式 BERT。