Dust: preentrenar transformers sin retropropagación
Dust: Pretraining Transformers Without Backpropagation

Dust es el primer método de orden cero competitivo con backprop para preentrenar transformers. En lugar de perturbar pesos, añade ruido gaussiano a las activaciones de cada token, de modo que un solo forward pass evalúa miles de miembros virtuales en paralelo. Según sus autores, es entre 10³ y 10⁴ veces más eficiente que EGGROLL, y los modelos grandes resultan más eficientes en población, no menos.
Contrariamente a la sabiduría convencional, los modelos más grandes suelen ser más eficientes en población, no menos, y pueden aprovechar poblaciones mayores.