100k 칩 없이 정면 돌파, Magic의 사전학습이 50배 적은 연산으로 DeepSeek V4 Pro를 따라잡다
>10x More Efficient Pretraining
Magic이 사전학습 레시피를 10배 이상 효율화했다고 밝혔다. DeepSeek V4 Pro Base와 동일한 성능을 약 50배 적은 FLOPs, 즉 GPT-3 사전학습 연산의 절반 수준인 GB200 기준 50만 달러로 달성했다. 10배 더 확장한 400만 달러 규모에서는 공개된 모든 오픈 베이스 모델을 perplexity 평가에서 앞섰다. 아키텍처, 옵티마이저, 학습 목표, 데이터 큐레이션에 걸친 수십 가지 변경이 곱셈적으로 누적된 결과다.
우리는 아마 세계에서 가장 작은 팀으로 조 단위 파라미터 모델을 학습시키고 있을 것이다. 강한 판단력을 가진 한 사람이 미칠 수 있는 영향력은 그 어느 때보다 커졌다.
HN 토론
53- woadwarrior01
그들은 2024년의 이것[1]처럼 이렇게 거창한 주장을 한 이력이 있는데, 눈에 보이는 제품이나 연구는 전혀 없습니다.
[1]: https://magic.dev/blog/100m-token-context-windows (그들의 블로그 게시물에도 링크되어 있음)
- simonw
> 우리는 약 50배 적은 FLOPs로 DeepSeek V4 Pro Base를 따라잡았습니다 – 이는 GPT3 사전학습 연산량의 약 절반, 즉 GB200에서 약 $0.5M에 해당합니다.
이게 사실이라면 정말 엄청난 일입니다.
- pvillano
많은 사람들이 AI 성능, 컴퓨팅 사용량, 사용자 기반, 구독 가격의 영원한 무한 성장에 돈을 걸고 있습니다.
저는 비용이 영원히 감소할 것이라고 생각합니다.
- ansk
제가 그들이 비교하는 특정 모델들에 대해 충분히 알지 못해서 단정할 수는 없지만, 제가 보기에는 그들이 자신들의 사전학습 모델을 다른 사람들의 사후학습 모델과 비교하는 것 같습니다.
그들의 10배 주장의 근거가 되는 지표(bits-per-byte)는 바로 사전학습 중에 최적화되는 지표입니다. 사후학습 모델은 다른 지표를 최적화하도록 미세 조정되는데, 이는 bits-per-byte 평가 성능에 해롭다고 알려져 있습니다. 따라서 bits-per-byte 평가에서는 사전학습 모델이 사후학습까지 거친 비교 가능한 모델에 비해 항상 유리하게 보일 수밖에 없습니다.
그들이 비교하는 모델들(DeepSeek V4, Kimi K2, Nemotron 3 Ultra)이 사후학습되었는지 확인해 주실 수 있나요?
- ismael_rr
정말 굉장하네요. 그들이 이를 달성하기 위해 무엇을 했는지에 대한 논문을 공개했으면 좋겠습니다. nous가 사전학습 FLOPs를 어느 정도 개선한 token superposition 논문을 발표한 기억이 있는데, 50배는 아니었습니다: https://nousresearch.com/token-superposition. 그들도 멋진 토큰화 전략을 찾은 건지 궁금하네요