LRU ist schwerer zu schlagen, als KV-Cache-Papers behaupten

LRU is harder to beat than the KV-cache papers suggest

Ein Entwickler hat 68.266 Anfragen aus 393 echten Claude-Code-Sitzungen und 23.608 Mooncake-Anfragen durch einen Prefix-Cache-Simulator gespielt und drei Versuche unternommen, den Produktions-Baseline LRU zu übertreffen – alle scheiterten. Der Grund: Unter Kapazitätsdruck entsteht der meiste Recompute durch Tool-Calling-Schleifen im Sekundenabstand, nicht durch Sitzungen, die ein TTL überschreiten. Der 5-Minuten-TTL feuerte nie. Die Arbeit reproduziert Mooncakes veröffentlichte Kurve und dokumentiert einen Harness-Bug, der Belady gegen LRU verlieren lässt.

Anfragen, die nach einer Lücke von mehr als 5 Minuten eintreffen, machen 17,5 % des Recompute aus. Anfragen, die innerhalb von 10 Sekunden eintreffen, machen 33,1 % aus.

Mehr von diesem Tag

2026-09-12