Dust:无需反向传播预训练 Transformer

Dust: Pretraining Transformers Without Backpropagation

Dust:无需反向传播预训练 Transformer

深度学习长期依赖反向传播进行训练,但 Dust 提出了一种全新的零阶优化方法,无需反向传播即可预训练 Transformer 语言模型。该方法通过在每个 token 上独立扰动激活值,构建虚拟种群,单次前向传播即可并行评估数千个样本。实验表明,Dust 在大种群设置下甚至能超越反向传播的效果,且比传统的权重空间进化策略高效数千倍。这项研究挑战了零阶方法无法扩展至大模型的固有认知,为未来基于搜索的信用分配算法奠定了基础。

随着全球可用算力的增长,我们或许更倾向于基于搜索的通用暴力学习算法,而非依赖可微性、反向传播等归纳偏置。

同日更多故事

2026-10-05