Dust обучает трансформеры без обратного распространения

Dust: Pretraining Transformers Without Backpropagation

Dust обучает трансформеры без обратного распространения

Исследователи из qlabs представили Dust — первый метод нулевого порядка, который конкурирует с backprop при предварительном обучении языковых моделей на основе трансформеров. Dust возмущает активации независимо для каждого токена, создавая виртуальную популяцию, и один прямой проход оценивает тысячи членов параллельно. Метод на порядки эффективнее весовых эволюционных стратегий и, вопреки распространённому мнению, показывает, что большие модели более популяционно-эффективны. Это открывает путь к обучению без дифференцируемости в эпоху больших вычислений.

Страшно, что большие модели оказываются более популяционно-эффективными, а не менее: модель с 243 млн параметров превосходит модель в 120 раз меньше при большинстве размеров популяции.

Ещё за этот день

2026-10-05