Dust trainiert Transformer ohne Backpropagation – und übertrifft sie manchmal
Dust: Pretraining Transformers Without Backpropagation

Dust ist eine Zeroth-Order-Methode, die Aktivatoren jedes Tokens unabhängig stört und so eine virtuelle Population erzeugt: Ein einziger Forward-Pass evaluiert Tausende von Mitgliedern parallel. Damit ist Dust beim Pretraining von Transformer-Sprachmodellen erstmals konkurrenzfähig zu Backprop – in manchen Einstellungen übertrifft es dieses sogar. Gegenüber gewichtsbasierten ES-Verfahren wie EGGROLL ist es um drei bis vier Größenordnungen effizienter. Überraschend: Größere Modelle sind populations-effizienter, nicht weniger.
Die bittere Lektion lautet, dass allgemeine Methoden, die mit Rechenleistung skalieren, irgendwann gewinnen.