自作C/C++推論エンジンでvLLMに匹敵、66MiBのバイナリが9.1GiBのPython環境に挑む
Why we write our own C and C++ inference engines

LocalAIが18のバックエンドをC/C++で自作する理由を解説。Python依存の重さや移植性の問題を回避し、単一ファイルでデプロイ可能にするためだ。vllm.cppはvLLMと同等のスループットを66MiBのバイナリで実現し、メモリ使用量も削減。depth-anything.cppはCPUでPyTorchより1.31倍高速、face-detect.cppはPython版と完全一致の出力を維持。パリティを確認した上で最適化する手法と、メンテナンスコストの課題も述べる。
パリティが置き換えを移行ではなくドロップインにするのだ。