拡散言語モデルの作り方:マスク拡散の仕組みと実装
How to build a diffusion language model

拡散モデルは画像生成で成功を収めていますが、テキストへの応用は長らく困難でした。本記事では、マスク拡散を用いた言語モデルの構築方法を解説します。トークンをマスクで置き換えることでノイズを定義し、双方向Transformerでマスクされた位置を予測します。生成時は全マスクから始めて徐々にアンマスクしていくことで、自己回帰モデルにはない誤り訂正や並列生成、双方向の文脈利用を実現します。2026年にはMercury 2、Gemma Diffusion、Nemotron Diffusionなどの拡散LLMが登場し、自己回帰モデルに匹敵する品質を達成しています。
マスク拡散は、BERTにランダムなマスク率を導入したものと本質的に同じですが、BERTとは異なり、結果として得られるモデルは生成的です。