66MiB 바이너리로 vLLM과 맞먹는 성능: LocalAI가 자체 C/C++ 추론 엔진을 만드는 이유

Why we write our own C and C++ inference engines

66MiB 바이너리로 vLLM과 맞먹는 성능: LocalAI가 자체 C/C++ 추론 엔진을 만드는 이유

LocalAI는 대부분의 백엔드에서 llama.cpp, vLLM 등 기존 엔진을 래핑하지만, 18개의 백엔드는 자체적으로 C/C++로 포팅했다. 그 이유는 Python 의존성, CUDA 전용 스택, C++ 구현이 없는 모델 등 배포할 수 없는 상황을 피하기 위해서다. 예를 들어 vLLM의 C++ 포트(vllm.cpp)는 66MiB 바이너리로 9.1GiB Python 환경과 동일한 성능을 내며, Depth Anything 3 포트는 CPU에서 PyTorch보다 1.31배 빠르고 메모리는 27%만 사용한다. 핵심은 가중치 변환, 그래프 포팅, 프로파일링 기반 최적화 순서이며, 패리티(정확성 일치)가 성능보다 우선한다.

패리티가 교체를 마이그레이션이 아닌 드롭인(drop-in)으로 만든다.

같은 날의 다른 소식

2026-08-03