Reame - CPU inference server that gets faster as it runs
Show HN: Reame – a CPU inference server that gets faster as it runs
Reameは、llama.cppをベースにしたCPUファーストのLLM推論サーバーです。共有vCPUや無料枠、2コアARMボックスなど、すでに所有している安価なハードウェアを最大限に活用することを目的としています。ディスクベースの共有プレフィックスKVキャッシュ、生成履歴アーカイブ、自己調整型投機的デコード、インターリーブ型マルチユーザー処理、多数決による品質向上機能「Conclave」など、CPU上で同じ計算を繰り返さないための革新的な機能を備えています。OpenAI互換のREST APIを提供し、プライバシーを重視した文書処理やバッチパイプライン、SaaSのAI機能などに最適です。
「CPU上では、同じことを二度計算しない。」