El CPU vuelve: replanteando la división CPU-GPU para la inferencia de LLM
The CPU is back: Rethinking the CPU-GPU split for LLM inference

Durante tres años, las GPU han dominado la conversación sobre los LLM, pero el auge de la IA agéntica y los modelos más pequeños está cambiando el equilibrio. Intel señala que la proporción CPU-GPU en inferencia ya es de 1:4, y en despliegues agénticos se acerca a 1:1, con algunos clientes usando 4 CPU por GPU. La investigación de Georgia Tech e Intel muestra que el procesamiento de herramientas en la CPU representa del 50 al 90% de la latencia total en cargas agénticas. Además, los SLM desplegados localmente ofrecen ventajas en latencia, privacidad y costo. NVIDIA ha lanzado la CPU Vera, diseñada específicamente para IA agéntica, y Morgan Stanley estima un crecimiento de mercado de $32.5 a $60 mil millones para 2030.
En cargas de trabajo agénticas, el procesamiento de herramientas del lado de la CPU representa del 50 al 90% de la latencia total de extremo a extremo.