自宅GPUでOpenAI互換APIを立てるならどれ? 2026年版セルフホスト推論オーケストレーター徹底比較
Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLM
2026年9月時点で存在するセルフホスト推論オーケストレーターを、スター数・マルチマシン対応・キャッシュ認識ルーティング・クラウドバースト・非LLMファンアウト・学習・Kubernetes対応などの軸で比較したリファレンス。Ollama、llama.cpp、vLLM、LocalAI、exo、GPUStack、Xinference、NVIDIA Dynamo、llm-d、SkyPilot、dstack、そして筆者自身のCoderAIまで、それぞれが実際に何をできるのか、どの状況で選ぶべきかを率直に整理している。
自分のプロジェクトのために行った調査のリファレンス版であり、CoderAIを動かしていない人にも役立つように書かれている。