셀프 호스팅 추론 오케스트레이터 7종, 한눈에 비교

Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLM

2026년 9월 기준 셀프 호스팅 추론 오케스트레이터 7종을 비교한 글이다. Ollama, llama.cpp, vLLM, LiteLLM, LocalAI, exo, GPUStack, Xinference, NVIDIA Dynamo, SkyPilot, dstack, CoderAI의 기능을 표로 정리하고, 각 도구가 어떤 상황에 적합한지 설명한다. 작성자는 자신의 프로젝트인 CoderAI도 소개하며, 이 도구가 다른 도구에 없는 3단계 에스컬레이션과 모든 모달리티의 분산 처리, 분산 LoRA 학습을 지원한다고 밝힌다.

여러분이 소유한 몇 대의 머신과 그것으로 충분하지 않을 때 빌리는 카드, 모든 모달리티, 하나의 엔드포인트: CoderAI. 또한 여기서 유일하게 여러분의 박스에 걸쳐 LoRA를 학습하는 도구이기도 하다.

이 날의 다른 글

2026-09-20