Reame - CPU inference server that gets faster as it runs

Show HN: Reame – a CPU inference server that gets faster as it runs

Reame - CPU inference server that gets faster as it runs

Reame는 llama.cpp 기반의 경량 LLM 추론 서버로, 공유 vCPU, 무료 티어, 2코어 ARM 박스 같은 저사양 CPU 하드웨어를 최우선으로 고려해 설계되었습니다. 핵심 아이디어는 'CPU에서는 같은 계산을 두 번 하지 않는다'는 것으로, 디스크 기반 공유 프리픽스 KV 캐시, 생성 아카이브(Palimpsest), 문법 기반 추측 생성(Il Suggeritore), 자가 조절 추측 디코딩, 다중 사용자 인터리빙, 다수결 합의(Conclave) 등을 통해 반복적인 워크로드에서 요청 비용을 극적으로 줄입니다. 실제 벤치마크에서 최대 4.8배의 엔드투엔드 속도 향상을 보여주며, OpenAI 호환 API와 제로 설정 CLI를 제공합니다. 문서 추출, 일괄 처리, 프라이버시 보호 작업 등에 적합하며, 하드웨어가 허락하는 범위 내에서 더 나은 품질을 얻고자 하는 사용자에게 매력적입니다.

Reame 서버는 실행 시간이 길어질수록 빨라집니다. 100번째 요청은 첫 번째 요청의 일부 비용만으로 처리됩니다 — 시스템 프롬프트는 한 번만 지불하면 됩니다.

이 날의 다른 글

2026-07-11