Cloudflare、KimiとGLMを高速化する3つの技術でコスト削減と精度維持を両立

Smaller, faster, safer: running Kimi and GLM at scale

Cloudflare、KimiとGLMを高速化する3つの技術でコスト削減と精度維持を両立

CloudflareのWorkers AIは、MoonshotのKimi KシリーズやZ.aiのGLMなど、大規模で長いコンテキストを持つMoEモデルをGPU上で効率的に提供するため、KVキャッシュの量子化(FP8)、モデル重みの圧縮(INT4)、共有KVキャッシュの整合性チェックという3つの技術を導入。これにより、メモリ使用量を削減し、同時リクエスト数を倍増させ、デコード速度を最大55%向上させながら、精度はほぼ無劣化(0.8ポイント以内)を実現。さらに、プリフィルとデコードを分離し、それぞれに最適な精度を適用することで、コスト削減と性能向上を両立している。

FP8 KVキャッシュは、BF16と比較して精度の差はなく、同時リクエスト数を倍増させ、コストを約30%削減できる。

同じ日のその他の記事

2026-08-03