Cloudflare, GPU 메모리 절반으로 줄여 Kimi와 GLM을 더 빠르게 서빙하다

Smaller, faster, safer: running Kimi and GLM at scale

Cloudflare, GPU 메모리 절반으로 줄여 Kimi와 GLM을 더 빠르게 서빙하다

Cloudflare가 Workers AI에서 대형 오픈 모델인 Moonshot의 Kimi K2.6과 Z.ai의 GLM 5.2를 서빙하기 위해 KV 캐시 양자화(FP8)와 가중치 압축(INT4)을 도입했다. FP8 KV 캐시는 메모리 사용량을 절반으로 줄여 동시 처리량을 최대 41% 높이고, INT4 가중치는 GLM의 디코드 속도를 최대 55% 향상시키면서도 정확도 손실은 거의 없다. 또한 공유 캐시의 무결성 검사를 추가해 안전성을 확보했다. 이러한 최적화는 비용을 낮추고 더 많은 고객을 지원하기 위한 것이다.

FP8 KV 캐시는 BF16과 비교해 정확도 차이가 없으면서도 동시 처리량을 41% 높이고, INT4 가중치는 디코드 속도를 최대 55% 향상시킨다.

같은 날의 다른 소식

2026-08-03