Reame - CPU inference server that gets faster as it runs

Show HN: Reame – a CPU inference server that gets faster as it runs

Reame - CPU inference server that gets faster as it runs

Reame ist ein schlanker, vollständig getesteter LLM-Inferenzserver auf Basis von llama.cpp, der speziell für günstige CPU-Hardware wie freie vCPUs oder ARM-Boards entwickelt wurde. Die Kernidee: Auf einer CPU niemals dieselbe Berechnung zweimal durchführen. Reame nutzt einen persistenten Disk-KV-Cache, der gemeinsame Prompt-Präfixe über Anfragen, Neustarts und Prozesse hinweg wiederverwendet, sowie ein Palimpsest genanntes Archiv, das frühere Generierungen als N-Gramm-Quelle für zukünftige Anfragen nutzt. Weitere Features sind selbstregulierendes spekulatives Decoding, die Conclave genannte Mehrheitswahl für bessere Qualität, sowie verschachteltes Multi-User-Serving. Reame bietet eine OpenAI-kompatible REST-API und eine Zero-Config-CLI. Messungen zeigen deutliche Beschleunigungen bei sich wiederholenden Workloads – ideal für Dokumentextraktion, Batch-Pipelines und datenschutzkritische Anwendungen.

„Ollama führt Modelle aus. Reame erinnert sich, sie ausgeführt zu haben.“

Mehr von diesem Tag

2026-07-11