ShapeLearn-Quantisierung für Qwen 3.8 27B erreicht 99,63 % der BF16-Qualität

Shapelearn Qwen 3.8 27B (13.1 GB VRAM)

ShapeLearn-Quantisierung für Qwen 3.8 27B erreicht 99,63 % der BF16-Qualität

ByteShape hat die vollständigen ShapeLearn-Quantisierungen für Qwen 3.8 27B veröffentlicht. Das Modell GPU-5 (IQ4_XS, 3,84 bpw) erreicht 99,63 % der BF16-Benchmark-Leistung bei 90,4 Tokens/s auf einer RTX Pro 6000 und belegt damit die Qualitäts-Geschwindigkeits-Grenze. Die frühere Lite-Version schnitt besser ab als ihr KLD-Ranking vermuten ließ. Spekulatives Decoding mit MTP oder DFlash2 steigert den Durchsatz; DFlash2 ist schneller, benötigt aber mehr Speicher und unterstützt keine Bildeingaben.

„GPU-5“ ist unsere Standardempfehlung, wo immer es passt: Es erreicht 90,4 Tokens/s bei 99,63 % der BF16-Baseline.

Mehr von diesem Tag

2026-09-18