Self-hosted Inference-Orchestrierung im Vergleich: LocalAI, exo, GPUStack und vLLM
Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLM
Ein detaillierter Vergleich selbstgehosteter Inferenz-Orchestrierer von September 2026: Ollama, llama.cpp, vLLM, LiteLLM, LocalAI, exo, Xinference, GPUStack, NVIDIA Dynamo, llm-d, SkyPilot, dstack und CoderAI. Der Autor – Entwickler von CoderAI – bewertet sie nach Modellen, Multi-Machine-Fähigkeit, Cache-aware Routing, Ops-Konsole, Cloud-Bursting und Training. Eine Tabelle mit GitHub-Sternen und Feature-Matrix hilft bei der Auswahl je nach Szenario: von einem einzelnen Rechner bis zum Kubernetes-Rack.
Was fehlt: Kubernetes, Apple Silicon, ein Modellkatalog und eine Community; und die Multi-Machine-Pfade sind gegen Fakes und localhost getestet, noch nicht über ein echtes Kabel.