誤差逆伝播に頼らず1000層のニューラルネットを訓練するPC-ALM
Backprop Alternative: Augmented Lagrangian Predictive Coding

Sakana AIが提案するPC-ALMは、各層にラグランジュ乗数(双対ニューロン)を導入し、層ごとのPIフィードバック制御器として機能させることで、局所的な計算のみで誤差逆伝播のクレジット信号を再現する。これにより、従来のPredictive Codingが抱えていた信号減衰問題を克服し、1000層の残差MLPを訓練できることを示した。線形ネットワークでは双対変数が厳密な逆伝播信号に収束することを証明。脳のような分散システムが逆伝播なしに勾配計算を実装する仕組みの解明や、ニューロモルフィックハードウェアでのエネルギー効率の良い深層学習に貢献する可能性がある。
我々の動機は、分散システム(脳など)が逆伝播なしにどのように勾配計算を実装できるかを理解することにある。
HNでの議論
45- lukeinator42
信用割り当て問題を解決する代替手段としての予測符号化には、脳内で起きていることのより妥当なモデルかもしれないという、興味深い研究がたくさんあります。
予測符号化の学習則を使うと、任意のネットワークにおいて誤差逆伝播とまったく同じ勾配が得られることを示したこの論文がとても気に入りました:
Predictive Coding Approximates Backprop Along Arbitrary Computation Graphs https://direct.mit.edu/neco/article/34/6/1329/110646/Predict...
- txhwind
シンプルだけど役に立つアイデアの素晴らしい入門ですね!ラグランジアンは時間平滑化された最適化方向の状態のように働きますが、微分不可能な境界であっても、どんな配線にも置くことができます!argmax、MoE、VQ-VAE のような離散コンポーネントに対する既存の学習手法よりも優れているのでしょうか?もしかすると、ネットワークは多くの学習可能な離散コンポーネント、あるいは最終的にはビットやゲートから構成できるのかもしれません。
- Jeff_Brown
これは継続的学習と関係があるのでしょうか?システム全体を止めずに更新できるのですね。
- rao-v
従来の誤差逆伝播で訓練された LLM を、このアプローチでファインチューニングに応用できるのではないかと思います(おそらくメモリと計算量が少なくて済む?)。LoRA と完全ファインチューニングの間のスペクトラムに、もう一つの選択肢として加わるかもしれません。
- AIorNot
わあ、神経科学における理論的含意にここで興奮しています——これは Friston のマルコフブランケット概念の潜在的なモデルなのでしょうか
「おそらく認知科学における『ベイズ的転回』の最も野心的で包括的なバージョンは、自由エネルギー原理(FEP)です。FEP は Karl Friston と同僚たちによって開発された数学的枠組みであり(Friston, Kilner, and Harrison 2006; Friston et al. 2010; Friston 2010; Friston et al. 2017a; Friston 2019)、あらゆる自己組織化システムが環境との適応的な交換を確実にするために最小化する必要がある目的関数を指定します。FEP の大きな魅力の一つは、生命科学(心理学、神経科学、理論生物学を含む)の前例のない統合を目指し(そしてそれを成し遂げているように見え)ることです。FEP と初期の推論理論(例えば Gregory 1980, Grossberg 1980, Rao and Ballard 1999, Lee and Mumford 2003)との違いは、知覚プロセスだけでなく、学習、注意、行動計画といった他の認知機能も、能動的推論のプロセスを通じた自由エネルギーの最小化という単一の原理の下に包含できることです(Friston 2010; Friston et al. 2017)。」