단 998달러로 3.8B LLM을 CORE 0.384까지 학습시킨 개인 프로젝트
Training a 3.8B LLM to 0.384 CORE for $998 – Hugo Vergnes
한 개인이 저녁 시간에 5090과 대여한 B200으로 3.8B 파라미터 모델을 65B 토큰에 걸쳐 43시간, 998달러에 학습시켜 CORE 0.384를 달성했다. GPT-2 1.5B(0.2565)와 nanochat d32(0.310)를 앞선다. Muon 옵티마이저, 사다리꼴 LR 스케줄, ClimbMix 데이터, FP8 학습 등이 주효했고, 문서 경계 마스킹이나 Liger 커널은 효과가 없어 되돌렸다.
내 모델은 nanochat d32보다 크지만 비슷한 시간이 걸렸다. B200은 H100보다 작업 단위당 가성비가 더 좋았다. 하지만 nanochat의 1,000달러 구성과 거의 같은 돈으로 이 모델은 의미 있게 앞선다.