LocalAI, exo, GPUStack o vLLM: qué orquestador de inferencia autoalojado elegir en 2026
Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLM
Comparativa de orquestadores de inferencia autoalojados en septiembre de 2026: Ollama, llama.cpp, vLLM, LiteLLM, LocalAI, exo, Xinference, GPUStack, NVIDIA Dynamo, llm-d, SkyPilot, dstack y CoderAI. Analiza modalidades, escalado multimáquina, descubrimiento automático, enrutamiento consciente de caché, consola de operaciones, ráfaga a la nube y entrenamiento distribuido. Incluye una guía para elegir según el caso: desde una sola máquina hasta un rack en Kubernetes.
Si tu hardware es Apple Silicon, nada más se acerca; si no lo es, exo todavía no es para ti.