連続拡散言語モデル(CDLM)が復活:その理由を解説
Continuous Diffusion Language Models (CDLM's)

画像や動画で成功した拡散モデルを言語生成に応用する研究が再び活発化している。2023年後半に一旦は離散拡散に取って代わられた連続拡散言語モデル(CDLM)だが、近年の研究の急増を受けて、その技術的詳細と復活の背景を解説する。本稿では、カテゴリカルデータへの連続拡散の適用方法(埋め込み戦略、損失関数、ノイズスケジュール、自己条件付け)を整理しつつ、2021年の初期の試みから2022年のブーム、そして2023年の「絶滅」を経て現在に至るまでの歴史を振り返る。著者は個人的な見解として、連続拡散の利点(トークン単位の不確実性の表現、豊富なサンプリング手法)を挙げ、復活の理由を考察する。
連続拡散には、個々のトークンレベルで不確実性を表現できる能力や、利用可能なサンプリングアルゴリズムやテクニックの豊富なツールボックスといった、いくつかの重要な利点があると私は信じている。
HNでの議論
35- janalsncm
[2020/2021年当時] 自己回帰モデルの優位性は、今ほど確立されていませんでした。GPT-3は注目を集めていましたが、「ChatGPTの瞬間」は2022年後半まで訪れませんでした。
これには同意できません。2020年、チャットにおいてデコーダーは完全に支配的でした。GPT-2は危険すぎるとして公開が見送られ、私はGPT-3のウェイティングリストに必死で登録したのを覚えています。それは機能しました。
(唯一の例外はエンコーダー・デコーダーモデルですが、現在は多くの場合デコーダーのみで行われています。)
しかし、それを主流にしたのはRLでした。最初はRLHF、その後DPOのようなセットアップの手間が少ない改良が加えられました。その上に拡散を追加するのは、さらに大きな手間になるでしょう。
ChatGPT以前は、事前学習と事後学習という概念はほとんどありませんでした。すべて事前学習でした。事後学習によって、ボットは「あなたが書いたものを続ける」だけでなく、会話ができるようになったのです。
つまり、要するに、拡散が普及しなかったのは、トークンを生成するより複雑な方法に過ぎず、本当の問題はトークンを正しい分布にすることだったからです。
- 2001zhaozhao
異なる速度で思考でき、出力テキストの前にではなく、出力テキストと並行して思考用スクラッチパッドを出力できるモデルを見てみたいです。
現在、モデルは高い知能をトークン/ステップごとに得るために、解読しにくい圧縮されたCoTに頼る必要がありますが、拡散を使えば、ステップごとにより多くのトークンを出力するだけで済むでしょう。
- p1esk
AI生成ではないものを読むのは新鮮です。
- vatsachak
自己回帰LLMにはまだ低い果実がぶら下がっていると感じます。エンコーダー
- Marchant_hq
CDLMは、より滑らかで一貫性のあるテキスト生成に有望に思えます。トークンレベルの不連続性にどう取り組むか、楽しみです。