逆伝播なしでTransformerを事前学習する「Dust」が登場

Dust: Pretraining Transformers Without Backpropagation

逆伝播なしでTransformerを事前学習する「Dust」が登場

QLabsの研究者らが、逆伝播を使わずにTransformer言語モデルを事前学習する初のゼロ次手法「Dust」を発表した。活性化にトークンごとに独立なノイズを加え、各トークンを仮想的な母集団メンバーとして一度の順伝播で並列評価する。大規模母集団では逆伝播を上回る場合もあり、重み空間ESより最大1万倍効率的。さらに大規模モデルほど母集団効率が高いことを示し、スケーリングの可能性を開く。

逆伝播は微分可能性を必要とし、深層学習のアーキテクチャ、オプティマイザ、ハードウェアはこの制約を中心に共進化してきた。しかし、世界で利用可能な計算量が増えるにつれ、微分可能性や逆伝播といった帰納バイアスよりも、検索に基づくより汎用的で力任せの学習アルゴリズムを好むようになるかもしれない。

この日のほかの記事

2026-10-05