1조 토큰을 한 달에 처리하려면 H100 GPU 367개가 필요하다

How many GPUs is 1M/B/T tokens?

1조 토큰을 한 달에 처리하려면 H100 GPU 367개가 필요하다

Cedana의 토큰-투-GPU 계산기에 따르면, Llama 3.3 70B 모델로 한 달 동안 1조 토큰을 처리하려면 H100 GPU 약 367개가 필요하다. 이는 초당 385,802 토큰을 처리해야 한다는 계산에서 나온다. 계산기는 처리량, 활용도, 입력 토큰 비용 등 여러 가정에 따라 GPU 수가 211개에서 853개까지 달라질 수 있다고 설명한다. B200은 H100보다 4~21배 빠르지만 모델별로 차이가 크다.

1조 토큰을 한 달(30일) 동안 Llama 3.3 70B로 처리하려면 H100 GPU 약 367개가 필요하다. 신뢰도는 보통이다.
  1. DiabloD3

    이 계산기는 좀 쓸모없어요. 모델마다 작동 방식이 다르고, 파라미터 수로 일반적으로 정의할 수 없는데, 나열된 모델들은 그냥 파라미터 수를 미리 채워 넣은 것 같아요.

    또한 추론에 사용되는 대부분의 카드를 놓치고 있고, 비교적 최신 Nvidia 카드로만 제한해요. 순전히 데이터센터용이라 해도 AMD 고객에게는 쓸모없을 거예요.

    그리고 모델마다 다르다는 점에 관해서도, kv 캐시 크기, 관리해야 할 동시 세션 수, kv 캐시 양자화의 연산 비용 오버헤드, 모델 양자화의 연산 비용 오버헤드를 이해하지 못해요. MTP나 DFlash가 뭔지도 모르고, 그에 맞춰 실효 tps를 높일 수도 없어요.

    예를 들어: Unsloth의 Qwen 3.8 Q4_K_M (4.5 BPW) 양자화 모델을 비교해보세요. MTP가 없는 괜찮은 소형 모델의 경우, 기준선이 100W당 약 3-6 TPS 정도일 거예요. 내장 MTP 모델을 쓰면 100W당 6-12 TPS에 가까워지고, 그 다음 Byteshape의 IQ4-XS (3.84 BPW)로 양자화를 바꾸고 권장 Dflash 드래프터를 사용하면 15-30 TPS 영역에 들어서게 됩니다.

    ... 그런데 계산기에 "27B, 27B active, 4-bit, 하루에 1B"라고 끄적이면, 내 비-MTP 수치의 하한인 것 같아요: 하루 1B = 초당 11574, B200 3대를 추천하는데, 각 B200은 1200W이므로 11574 / (1200*3) = 3.215, 그런데 실제 결과는 2배에서 10배 더 높을 거예요.

    또한 웹사이트에서 인용하자면, "대형 모델에 대한 A100 및 V100 결과는 이론치입니다." 소규모 추론 사람들은 […]

  2. dannyw

    죄송하지만 이건 바이브 코딩된 마케팅 쓰레기 같고 매우 부정확해요.

    첫째, 프롬프트/KV 캐싱에 대한 고려가 전혀 없는데, 특히 대규모 워크로드에서는 이게 기본적으로 필수라는 건 우리 모두 알고 있죠.

    둘째, 모든 벤치마크를 배치 크기 1로 기준 삼은 것 같아요.

    B200이나 H100 클러스터를 돌리는 사람 중에 배치 크기 1로 추론하는 사람은 아무도 없어요.

    더 심각한 건, 계산기가 컨텍스트 윈도우 0 토큰으로 모델을 실행한다고 가정하는 것 같아요? 그건 GPU 수에 엄청난 영향을 미치는데.

    사소한 세부 사항이나 의도적 단순화를 트집 잡는 게 아니지만, 여기서 나오는 추정치는 몇 배나 horrendously 부정확해요.

이 날의 다른 글

2026-10-07