¿Cuántas GPUs se necesitan para un billón de tokens?

How many GPUs is 1M/B/T tokens?

¿Cuántas GPUs se necesitan para un billón de tokens?

Una calculadora interactiva estima que servir 1 billón de tokens en un mes con Llama 3.3 70B requiere aproximadamente 367 GPUs H100, con un rango plausible de 211 a 853. El cálculo desglosa el rendimiento por segundo, la mezcla de tokens, la utilización y la velocidad por GPU. También ofrece estimaciones para A100, V100 y B200, y analiza cómo varían los resultados según los supuestos.

El resultado es una estimación de planificación. Espere un error de 2x en cada dirección para los presets medidos, y más para los presets estimados. Mida su modelo en su hardware antes de comprar.
  1. DiabloD3

    Esta calculadora es bastante inútil. Diferentes modelos funcionan de manera distinta, no puedes definirlos genéricamente por su número de parámetros, y los modelos que lista parecen ser simplemente ella rellenando los conteos de parámetros por ti.

    Además, omite la mayoría de las tarjetas que se usan para inferencia, limitándose solo a tarjetas Nvidia relativamente recientes. Incluso si esto fuera puramente para centros de datos, sería inútil para clientes de AMD.

    Y en cuanto a que diferentes modelos son diferentes, tampoco entiende el tamaño de la caché kv, cuántas sesiones concurrentes necesitas gestionar, el costo computacional adicional de la cuantización de la caché kv, ni el costo computacional adicional de la cuantización del modelo. Tampoco sabe qué es MTP ni DFlash, y no puede aumentar tu tps efectivo para igualarlo.

    Como ejemplo: compara el quant de Unsloth de Qwen 3.8 Q4_K_M (4.5 BPW), un modelo más pequeño decente, sin MTP, obtendrías una línea base de, digamos, alrededor de 3-6 TPS por 100W. Con el modelo MTP incorporado, te acercas más a 6-12 TPS por 100W; luego, cambia los quants al IQ4-XS de Byteshape (3.84 BPW) y usa su drafter Dflash sugerido, ahora estás en el rango de 15-30 TPS

    ... sin embargo, si garabateo en la calculadora "27B, 27B activos, 4-bit, 1B por un día", parece ser el extremo inferior de mi cifra sin MTP: 1B por día = 11574 por segundo, recomienda 3x B200s, cada B200 es 1200W, así que 11574 / (1200*3) = 3.215, pero los resultados del mundo real serían de 2x a 10x más altos.

    También, citando del sitio web, "Los resultados de A100 y V100 para los modelos grandes son teóricos". La gente de inferencia a pequeña escala […]

  2. dannyw

    Lo siento, pero esto parece marketing generado por vibe coding que es altamente inexacto.

    Para empezar, hay cero consideración del prompt/KV caching, que todos sabemos que es básicamente esencial, especialmente para cargas de trabajo a escala.

    En segundo lugar, parece basar todos los benchmarks en un tamaño de lote de 1.

    Nadie que ejecute un clúster de B200s o H100s está haciendo inferencia con tamaños de lote de 1.

    Y peor aún, ¿la calculadora asume que ejecutas modelos con una ventana de contexto de 0 tokens? Eso afecta masivamente cuántas GPUs necesitas.

    No estoy siendo quisquilloso con pequeños detalles o simplificaciones intencionales aquí, pero las estimaciones que da son horriblemente inexactas por varios múltiplos.

Más de este día

2026-10-07