Cloudflare:让 Kimi 和 GLM 更小巧快速安全

Smaller, faster, safer: running Kimi and GLM at scale

Cloudflare:让 Kimi 和 GLM 更小巧快速安全

在 Cloudflare 的 Workers AI 上运行 Moonshot 的 Kimi 和 Z.ai 的 GLM 这类超大模型极具挑战。我们通过三项关键技术突破瓶颈:将 KV cache 量化为 FP8,使上下文容量翻倍;将模型权重压缩为 INT4,显著降低显存占用并提升解码速度;同时引入缓存完整性检查,在共享硬件环境下确保数据安全。这些优化在保持模型精度不变的前提下,大幅降低了服务成本,让 SGLang 框架能更高效地支持更多并发请求。

夸张换来一次点击,失去的是读者的长期信任。
  1. scrlk

    很高兴看到有服务商公开透明地讨论 KV 缓存量化。我一直怀疑有些服务商在大力推广未量化权重的同时,却在静默地进行 KV 量化,尽管 KV 量化对质量的损害可能比权重量化更严重。

    不过,我希望他们的测试能更详细一些。首先,不同模型家族对 KV 量化的敏感度不同(他们只测试了 Kimi K2.6)。其次,他们用来声称 FP8 KV 量化“无法区分”的评估套件明显缺乏代码基准测试;在长运行任务中,微小的工具调用错误会随时间累积。

  2. HDBaseT

    我认为 Cloudflare 不在其推理服务中提供 ZDR,是表明 Cloudflare 本身就在“发光”(glows)的最明显公开信号。

    我们让所有流量被中间人攻击(MITM),现在又让我们的 AI 对话被追踪。Cloudflare 闻起来就像一个美国蜜罐。

  3. syntaxing

    > 在 Cloudflare 仪表板中查看定价 ↗

    为什么……我想看看使用 Cloudflare 的端点是否值得,但我甚至看不到定价信息。

  4. om8

    为什么是 int4?有很多更优秀的 4 位格式,比如 bitsandbytes 中的 nf4。

  5. joshuamcginnis

    > 如果你热衷于将最好的开源模型压缩到 GPU 上,并为数百万开发者提供服务,欢迎加入我们。

    这个职位的典型头衔和/或技能要求是什么?

同日更多故事

2026-08-03