MemStitch - Zero-copy KV cache stitching for vLLM
Show HN: MemStitch – Zero-copy context bridging for vLLM (25x TTFT speedup)

MemStitch는 멀티 에이전트 GPU 추론 환경에서 긴 문서를 여러 에이전트가 순차적으로 처리할 때 발생하는 중복 prefill 단계를 제거하는 제로카피 컨텍스트 브리징 게이트웨이입니다. PagedAttention 기반으로 KV 캐시를 메모리 수준에서 동적으로 스티칭하여, 이전 에이전트가 처리한 컨텍스트를 다음 에이전트가 재사용할 수 있게 합니다. 이를 통해 TTFT(Time-to-First-Token) 지연 시간을 최대 25배 단축하고, GPU VRAM 사용량을 40% 이상 절약할 수 있습니다. Python SDK 데코레이터와 OpenAI 호환 REST API를 제공하여 다양한 에이전트 오케스트레이션 환경에 쉽게 통합할 수 있으며, 실시간 개발자 대시보드를 통해 캐시 블록 상태와 보안 정책을 모니터링할 수 있습니다. 제로트러스트 보안 게이트를 통해 에이전트 간 접근 권한을 제어하여 안전한 공유를 보장합니다.
MemStitch는 값비싼 prefill 단계를 우회하고 KV 캐시를 메모리 수준에서 동적으로 스티칭하여, 협업 LLM 워크플로우에서 TTFT 지연 시간을 최대 25배 단축하고 40% 이상의 VRAM을 절약합니다.