Kimi y GLM más pequeños, rápidos y seguros: así los ejecuta Cloudflare a escala

Smaller, faster, safer: running Kimi and GLM at scale

Kimi y GLM más pequeños, rápidos y seguros: así los ejecuta Cloudflare a escala

Cloudflare optimiza el servicio de los modelos Moonshot Kimi K-series y Z.ai GLM en Workers AI mediante tres técnicas: cuantización de la caché KV a FP8, compresión de pesos a INT4 y verificación de integridad de la caché. Estas mejoras duplican el contexto admisible, aumentan el rendimiento hasta un 41% y reducen costes sin pérdida de precisión, todo implementado con SGLang.

La caché es lo que permite al modelo extender una conversación larga sin tener que releer todo el contexto en cada nuevo token.

Más de este día

2026-08-03