데이터 가중치의 스케일링 법칙은 왜 중간 규모에서 꼭대기를 이룰까?

A study of sequence weighting at scale

데이터 가중치의 스케일링 법칙은 왜 중간 규모에서 꼭대기를 이룰까?

Jane Street의 연구진은 내부 및 오픈 웨이트 언어 모델에서 데이터 가중치의 스케일링 법칙을 연구했다. 훈련 중 시퀀스에 부여된 가중치와 손실 감소의 관계를 측정한 결과, 모델 규모가 커질수록 가중치에 대한 의존도가 비단조적으로 변했다. 작은 모델은 가중치와 무관하게 일반 패턴을 학습하고, 중간 규모에서는 가중치에 비례해 데이터 특정 패턴을 학습하며, 대규모에서는 다시 가중치와 무관하게 모든 패턴을 학습하는 경향을 보였다. 에포킹은 이 피크를 더 작은 모델로 이동시켰다. 이러한 변칙적 스케일링은 데이터 혼합 전략을 세울 때 주의가 필요함을 시사한다.

우리의 결과는 일반적인 추세와 일치한다: 모델이 작은 규모에서 중간 규모로 전환할 때, 데이터 가중치와 무관하게 일반 패턴을 학습하는 것에서 데이터 가중치에 비례하여 데이터 특정 패턴을 학습하는 것으로 전환된다. 그런 다음 모델이 중간 규모에서 큰 규모로 전환하면, 데이터에 존재하는 모든 패턴을 다시 데이터 가중치와 무관하게 학습할 수 있게 된다.

이 날의 다른 글

2026-09-22