Llama 3.3 70Bで月間1兆トークン処理に必要なGPUは367台

How many GPUs is 1M/B/T tokens?

Llama 3.3 70Bで月間1兆トークン処理に必要なGPUは367台

Cedanaが公開した計算ツールによると、Llama 3.3 70Bで1ヶ月に1兆トークンを処理するにはH100 GPUが約367台必要。ただし、GPU性能や利用率などの前提次第で211台から853台まで変動する。B200なら92台で済むが、大規模MoEモデルではその優位性がさらに拡大する。

1兆トークンを1ヶ月(30日)で処理するには、Llama 3.3 70Bで約367台のH100 GPUが必要。信頼度は中程度。
  1. DiabloD3

    この計算機はほとんど役に立たない。モデルによって動作が異なるし、パラメータ数だけで一般的に定義できるものではない。しかも、リストされているモデルは、単にパラメータ数を事前に入力してくれているだけのように見える。

    推論に使われているほとんどのカードが抜けていて、比較的最近のNvidiaのカードに限定されている。たとえこれが純粋にデータセンター向けだとしても、AMDの顧客には役に立たないだろう。

    さらに、モデルが異なれば異なるという点についても、kvキャッシュのサイズ、管理する必要がある同時セッション数、kvキャッシュ量子化の計算コストのオーバーヘッド、モデル量子化の計算コストのオーバーヘッドを理解していない。また、MTPやDFlashが何であるかも知らず、それに合わせて実効tpsを増やすこともできない。

    例を挙げよう:UnslothのQwen 3.8 Q4_K_M(4.5 BPW)の量子化版、まともな小さめのモデルを比較すると、MTPなしでは、例えば100Wあたり3~6 TPS程度のベースラインが得られる。内蔵のMTPモデルを使えば、100Wあたり6~12 TPSに近づく。さらに、量子化をByteshapeのIQ4-XS(3.84 BPW)に切り替え、推奨されるDflashドラフターを使えば、15~30 TPSの領域に達する。

    ...しかし、計算機に「27B、27Bアクティブ、4ビット、1日あたり1B」と書き込むと、MTPなしの数値の下限、つまり1日あたり1B = 毎秒11574となり、3台のB200を推奨してくる。各B200は1200Wなので、11574 / (1200*3) = 3.215だが、実際の結果は2倍から10倍高くなるだろう。

    また、ウェブサイトから引用すると、「大規模モデルのA100とV100の結果は理論値です」。小規模推論の人々は […]

  2. dannyw

    申し訳ないが、これは雰囲気でコーディングされたマーケティングのゴミで、非常に不正確に見える。

    第一に、プロンプト/KVキャッシュについて全く考慮されていない。これは、特に大規模なワークロードでは基本的に不可欠だと誰もが知っている。

    第二に、すべてのベンチマークがバッチサイズ1に基づいているようだ。

    B200やH100のクラスタを動かしている人は、バッチサイズ1で推論などしない。

    さらに悪いことに、この計算機はコンテキストウィンドウ0トークンでモデルを実行することを前提としているのか?それは必要なGPUの数に大きく影響する。

    ここで小さな詳細や意図的な単純化について揚げ足を取っているわけではないが、この計算機が出す推定値は数倍単位で恐ろしく不正確だ。

この日のほかの記事

2026-10-07