1 Billionen Tokens pro Monat: 367 H100 GPUs für Llama 3.3 70B
How many GPUs is 1M/B/T tokens?

Ein neuer Rechner von Cedana schätzt den GPU-Bedarf für LLM-Inferenz. Für 1 Billion Tokens in 30 Tagen mit Llama 3.3 70B sind rund 367 H100 GPUs nötig – bei 50 % Auslastung und 1.000 Tokens/s pro GPU. Die Unsicherheit ist groß: Je nach Annahmen liegt der Bedarf zwischen 211 und 853 GPUs. Der Rechner zeigt auch, welche Stellschraube das Ergebnis am stärksten beeinflusst.
Die Unsicherheit ist erheblich: Rechnen Sie mit einem Fehler von 2x in jede Richtung für gemessene Presets und mehr für geschätzte.
- DiabloD3
Dieser Rechner ist ziemlich nutzlos. Verschiedene Modelle funktionieren unterschiedlich, man kann sie nicht generisch anhand der Parameteranzahl definieren, und die Modelle, die er auflistet, scheinen einfach nur die Parameteranzahlen für dich vorauszufüllen.
Außerdem fehlen die meisten Karten, die für Inferenz verwendet werden, und er beschränkt sich nur auf relativ neue Nvidia-Karten. Selbst wenn dies rein für Rechenzentren gedacht wäre, wäre es für AMD-Kunden nutzlos.
Und was die Unterschiede zwischen den Modellen angeht: Er versteht auch nicht die KV-Cache-Größe, wie viele gleichzeitige Sitzungen du verwalten musst, den Rechenkosten-Overhead der KV-Cache-Quantisierung oder den Rechenkosten-Overhead der Modellquantisierung. Er weiß auch nicht, was MTP oder DFlash ist, und kann deine effektiven tps nicht entsprechend erhöhen.
Ein Beispiel: Vergleiche Unsloths Quantisierung von Qwen 3.8 Q4_K_M (4,5 BPW), ein anständiges kleineres Modell, ohne MTP erhältst du eine Basis von sagen wir etwa 3-6 TPS pro 100W. Mit dem integrierten MTP-Modell kommst du näher an 6-12 TPS pro 100W; dann wechsle die Quantisierung zu Byteshapes IQ4-XS (3,84 BPW) und verwende deren vorgeschlagenen Dflash-Drafter, und du bist jetzt im Bereich von 15-30 TPS
... doch wenn ich in den Rechner kritzle "27B, 27B aktiv, 4-Bit, 1B pro Tag", scheint es das untere Ende meiner Nicht-MTP-Zahl zu sein: 1B pro Tag = 11574 pro Sekunde, es empfiehlt 3x B200s, jede B200 hat 1200W, also 11574 / (1200*3) = 3,215, doch reale Ergebnisse wären 2x bis 10x höher.
Außerdem, Zitat von der Website: "A100- und V100-Ergebnisse für die großen Modelle sind theoretisch." Die Leute mit Inferenz im kleinen Maßstab […]
- dannyw
Es tut mir leid, aber das sieht aus wie vibe-codierter Marketing-Müll, der extrem ungenau ist.
Erstens gibt es keinerlei Berücksichtigung von Prompt-/KV-Caching, was, wie wir alle wissen, im Grunde essenziell ist, besonders für Workloads im großen Maßstab.
Zweitens scheint es alle Benchmarks auf einer Batch-Größe von 1 zu basieren.
Niemand, der einen Cluster aus B200s oder H100s betreibt, führt Inferenz mit Batch-Größen von 1 durch.
Und noch schlimmer: Der Rechner geht davon aus, dass du Modelle mit einem Kontextfenster von 0 Token betreibst? Das beeinflusst massiv, wie viele GPUs benötigt werden.
Ich bin hier nicht kleinlich bei Details oder beabsichtigten Vereinfachungen, aber die Schätzungen, die das liefert, sind horrend ungenau um einige Vielfache.