ByteShape выпустила полные кванты ShapeLearn для Qwen 3.8 27B: GPU-5 достигает 99.63% качества BF16
Shapelearn Qwen 3.8 27B (13.1 GB VRAM)
ByteShape завершила полный прогон ShapeLearn для Qwen 3.8 27B и сравнила его с ранними Lite-версиями и квантами конкурентов. Все пять моделей ShapeLearn остаются на границе качество-скорость, а GPU-5 (IQ4_XS, 3.84 bpw) достигает 99.63% агрегированного балла BF16 при 90.4 tok/s. GPU-4 даёт 98.72% при меньшем размере (11.0 ГБ). Спекулятивное декодирование с MTP или DFlash2 увеличивает пропускную способность, но DFlash2 требует больше памяти и не поддерживает изображения.
GPU-5 — наш выбор по умолчанию везде, где он помещается: он достигает 90.4 tok/s при 99.63% от базового уровня BF16.