Die CPU kehrt zurück: Warum die CPU-GPU-Aufteilung bei LLM-Inferenz neu gedacht wird
The CPU is back: Rethinking the CPU-GPU split for LLM inference

GPUs dominieren seit Jahren die LLM-Inferenz, doch agentische KI und kleinere, lokale Modelle verschieben das Gleichgewicht. Intel meldet eine Verschiebung des CPU-zu-GPU-Verhältnisses von 1:8 (Training) auf bis zu 4:1 (agentische Workloads). CPU-seitige Tool-Verarbeitung macht laut einer Studie 50–90 % der End-to-End-Latenz aus. NVIDIA bringt mit Vera eine CPU speziell für agentische KI auf den Markt, und Morgan Stanley prognostiziert bis 2030 ein zusätzliches CPU-Marktwachstum von 32,5–60 Mrd. US-Dollar.
In agentischen Workloads macht die CPU-seitige Tool-Verarbeitung 50–90 % der gesamten End-to-End-Latenz aus.