Dust, 역전파 없이 트랜스포머 사전학습에 도전하다
Dust: Pretraining Transformers Without Backpropagation

QLabs의 Dust는 역전파 없이 트랜스포머 언어 모델을 사전학습하는 0차 방법이다. 각 토큰의 활성화에 독립적으로 노이즈를 주입해 하나의 순전파로 수천 개의 가상 개체를 병렬 평가한다. 큰 규모에서는 역전파를 능가하기도 하며, 기존 진화 전략보다 1,000~10,000배 효율적이다. 놀랍게도 모델이 클수록 개체 효율이 높아진다.
0차 방법은 대규모 네트워크로 확장되지 않는다고 널리 믿어져 왔다. 놀랍게도 우리는 더 큰 모델이 개체 효율적이라는 사실을 발견했다: 243M 파라미터 모델이 대부분의 개체 크기에서 120배 작은 모델을 능가한다.