MemStitch - Zero-copy context bridging for vLLM
Show HN: MemStitch – Zero-copy context bridging for vLLM (25x TTFT speedup)

MemStitch es una pasarela de inferencia GPU para flujos de trabajo multiagente que elimina la costosa fase de prefill al unir dinámicamente las cachés KV a nivel de memoria mediante PagedAttention. Esto reduce la latencia TTFT hasta 25 veces y ahorra más del 40% de VRAM cuando varios agentes procesan el mismo documento largo. Con un hash topológico de contexto y un mecanismo de seguridad zero-trust, MemStitch permite compartir bloques de caché entre agentes de forma segura. Ofrece un portal de desarrollo visual, SDK de Python y API compatible con OpenAI para una integración sencilla.
MemStitch elimina la costosa fase de prefill al unir las cachés KV a nivel de memoria, logrando una aceleración de 25 veces en la latencia inicial y un ahorro de más del 40% de VRAM en flujos de trabajo colaborativos con LLM.