Dust trainiert Transformer ohne Backpropagation – und übertrifft sie manchmal

Dust: Pretraining Transformers Without Backpropagation

Dust trainiert Transformer ohne Backpropagation – und übertrifft sie manchmal

Dust ist eine Zeroth-Order-Methode, die Aktivatoren jedes Tokens unabhängig stört und so eine virtuelle Population erzeugt: Ein einziger Forward-Pass evaluiert Tausende von Mitgliedern parallel. Damit ist Dust beim Pretraining von Transformer-Sprachmodellen erstmals konkurrenzfähig zu Backprop – in manchen Einstellungen übertrifft es dieses sogar. Gegenüber gewichtsbasierten ES-Verfahren wie EGGROLL ist es um drei bis vier Größenordnungen effizienter. Überraschend: Größere Modelle sind populations-effizienter, nicht weniger.

Die bittere Lektion lautet, dass allgemeine Methoden, die mit Rechenleistung skalieren, irgendwann gewinnen.

Mehr von diesem Tag

2026-10-05