Kleiner, schneller, sicherer: Kimi und GLM im großen Maßstab
Smaller, faster, safer: running Kimi and GLM at scale

Workers AI betreibt große Open-Source-Modelle wie Kimi K2.6 und GLM 5.2 auf GPUs in Cloudflare-Rechenzentren. Drei Optimierungen machen das effizienter: FP8-Quantisierung des KV-Cache verdoppelt den nutzbaren Kontext, INT4-Gewichte halbieren den Speicherbedarf und beschleunigen das Decoding um bis zu 55 %, und ein Integritätscheck schützt den geteilten Cache bei minimalem Overhead. Dadurch lassen sich mehr Anfragen pro GPU verarbeiten – bei gleicher Genauigkeit.
Bei einer Konkurrenz von 64 Anfragen erreicht FP8 2.192 Tokens pro Sekunde, etwa 41 % mehr als der BF16-Spitzenwert, bei rund 30 % geringeren Kosten pro Token.