PC-ALM:无需反向传播训练千层网络
Backprop Alternative: Augmented Lagrangian Predictive Coding

大脑无法像计算机那样运行反向传播,但如何分配多层网络的信用信号一直是神经科学的难题。PC-ALM 提出了一种基于局部动力学的替代方案,利用增广拉格朗日方法(Augmented Lagrangian)和预测编码(Predictive Coding),成功在无需全局反向传播的情况下,训练出深度达 1000 层的残差 MLP 网络。该方法通过引入对偶神经元(dual neurons)作为 PI 反馈控制器,有效解决了传统预测编码在深层窄网络中的信号衰减问题。这不仅为理解生物大脑的梯度计算提供了新视角,也为在神经形态硬件上实现更节能的深度学习训练开辟了新路径。
全局的信用分配是从局部反馈控制器的网络中涌现出来的。
HN 评论区
45- lukeinator42
关于预测编码(predictive coding)作为解决信用分配问题的另一种手段,目前有很多有趣的研究,它可能比现有模型更合理地解释了大脑中的运作机制。
我非常喜欢这篇论文,它展示了使用预测编码学习规则可以在任意网络中得到与反向传播完全相同的梯度:
Predictive Coding Approximates Backprop Along Arbitrary Computation Graphs https://direct.mit.edu/neco/article/34/6/1329/110646/Predict...
- txhwind
这是一个简单但非常有用的想法的精彩介绍!拉格朗日量(Lagrangian)的作用就像一个时间平滑的优化方向状态,但它可以被放置在任意导线上,甚至是在不可微的边界处!它能否在离散组件(如 argmax、MoE 或 VQ-VAE)上优于现有的训练方法?也许网络最终可以由大量可学习的离散组件,甚至是比特和门电路构成。
- Jeff_Brown
这与持续学习(continual learning)有关吗?它允许你在不暂停整个系统的情况下进行更新。
- rao-v
我想知道是否可以对一个经过传统反向传播训练的大语言模型(LLM)应用这种方法进行微调(想必所需的内存和计算量会更少?)。这可能是介于 LoRA 和全量微调之间的另一种方案。
- AIorNot
哇,这里关于神经科学的理论意义让我很兴奋——这是否可能是 Friston 的“马尔可夫毯”(Markov Blanket)概念的潜在模型?
“认知科学中‘贝叶斯转向’(Bayesian turn)最雄心勃勃、最全面的版本可能是自由能原理(FEP)。FEP 是由 Karl Friston 及其同事(Friston, Kilner, and Harrison 2006; Friston et al. 2010; Friston 2010; Friston et al. 2017a; Friston 2019)开发的数学框架,它规定了任何自组织系统为了确保与环境进行自适应交换而必须最小化的目标函数。FEP 的一个主要吸引力在于,它旨在(并且似乎确实实现了)对生命科学(包括心理学、神经科学和理论生物学)前所未有的整合。FEP 与早期推理理论(例如 Gregory 1980, Grossberg 1980, Rao and Ballard 1999, Lee and Mumford 2003)的区别在于,它不仅涵盖了感知过程,还将其他认知功能(如学习、注意力和动作规划)都纳入了一个单一原则之下:通过主动推理(active inference)过程最小化自由能(Friston 2010; Friston et al. 2017)。”