Dust: preentrenar transformers sin retropropagación

Dust: Pretraining Transformers Without Backpropagation

Dust: preentrenar transformers sin retropropagación

Dust es el primer método de orden cero competitivo con backprop para preentrenar transformers. En lugar de perturbar pesos, añade ruido gaussiano a las activaciones de cada token, de modo que un solo forward pass evalúa miles de miembros virtuales en paralelo. Según sus autores, es entre 10³ y 10⁴ veces más eficiente que EGGROLL, y los modelos grandes resultan más eficientes en población, no menos.

Contrariamente a la sabiduría convencional, los modelos más grandes suelen ser más eficientes en población, no menos, y pueden aprovechar poblaciones mayores.

Más de este día

2026-10-05