拡散言語モデルの作り方:マスク拡散の仕組みと実装

How to build a diffusion language model

拡散言語モデルの作り方:マスク拡散の仕組みと実装

拡散モデルは画像生成で成功を収めていますが、テキストへの応用は長らく困難でした。本記事では、マスク拡散を用いた言語モデルの構築方法を解説します。トークンをマスクで置き換えることでノイズを定義し、双方向Transformerでマスクされた位置を予測します。生成時は全マスクから始めて徐々にアンマスクしていくことで、自己回帰モデルにはない誤り訂正や並列生成、双方向の文脈利用を実現します。2026年にはMercury 2、Gemma Diffusion、Nemotron Diffusionなどの拡散LLMが登場し、自己回帰モデルに匹敵する品質を達成しています。

マスク拡散は、BERTにランダムなマスク率を導入したものと本質的に同じですが、BERTとは異なり、結果として得られるモデルは生成的です。

この日のほかの記事

2026-08-31