LLM 推理突发流量:预测式 KV 复制

Predictive Speculative KV Replication for Bursty LLM Inference

LLM 推理突发流量:预测式 KV 复制

在 LLM 推理中,突发流量常让传统路由策略失效:Least Load 策略导致重复计算,Cache Aware 策略引发队列堆积。JW Labs 提出 Biting the Bullet 方案,通过预测突发请求,利用 RDMA 提前将 KV cache 预加载到目标 GPU。我们对比了 HBM、RAM、RDMA 等不同存储层级的性能,发现 RDMA 比重新计算快 44 倍。针对现有数据集缺乏真实突发场景的问题,我们构建了 Bursted-ART 数据集。该方案在 Infer-Sim 模拟器中验证,能显著降低延迟,解决同前缀请求的推理瓶颈。

如果能在看到请求流涌入时预测到突发流量,并自动通过 RDMA 共享前缀缓存,那将比等待队列堆积或盲目分发请求快得多。

同日更多故事

2026-07-31