8x RTX PRO 6000: cómo exprimir 768 GB de VRAM sin NVLink

A practical guide to running 8x RTX PRO 6000's

8x RTX PRO 6000: cómo exprimir 768 GB de VRAM sin NVLink

Una guía práctica para sacar el máximo partido a un sistema con 8 GPUs NVIDIA RTX PRO 6000 Blackwell conectadas por PCIe Gen 5. En lugar de intentar dividir modelos masivos de 400B+ (tarea que provoca alta latencia), el artículo propone estrategias como servir modelos independientes en cada GPU (TP=1), alojar flotas de microservicios de 8B-32B, o realizar fine-tuning de modelos de 70B con offloading a la memoria del host. Con 768 GB de VRAM GDDR7 y un AMD EPYC 9555, se pueden alcanzar hasta 1,15 millones de tokens activos por GPU y ejecutar 24-32 endpoints de 8B simultáneamente. Incluye tablas comparativas de rendimiento y consejos de orquestación.

En lugar de forzar un paralelismo de modelo profundo a través de PCIe, tiene más sentido explorar qué cargas de trabajo podemos manejar a una fracción del precio de algo como un HGX B200/B300 sin sacrificar demasiado rendimiento.

Más de este día

2026-09-02