Cloudflare:让 Kimi 和 GLM 更小巧快速安全
Smaller, faster, safer: running Kimi and GLM at scale

在 Cloudflare 的 Workers AI 上运行 Moonshot 的 Kimi 和 Z.ai 的 GLM 这类超大模型极具挑战。我们通过三项关键技术突破瓶颈:将 KV cache 量化为 FP8,使上下文容量翻倍;将模型权重压缩为 INT4,显著降低显存占用并提升解码速度;同时引入缓存完整性检查,在共享硬件环境下确保数据安全。这些优化在保持模型精度不变的前提下,大幅降低了服务成本,让 SGLang 框架能更高效地支持更多并发请求。
夸张换来一次点击,失去的是读者的长期信任。