Reame - CPU inference server that accelerates with use
Show HN: Reame – a CPU inference server that gets faster as it runs
Reame es un servidor de inferencia LLM optimizado para hardware CPU económico, como VPS compartidos o instancias gratuitas. Aprovecha cachés de prefijo persistentes en disco, decodificación especulativa autorregulada y un archivo de generaciones para evitar recalcular lo ya hecho, haciendo que el servidor sea más rápido con cada petición. Incluye una API compatible con OpenAI, soporte multi-usuario y funciones como el Conclave para mejorar la calidad mediante consenso. Ideal para tareas repetitivas de extracción o clasificación sobre datos propios, con privacidad total y coste marginal cero.
En una CPU, nunca calcules lo mismo dos veces.