ByteShapeのShapeLearn、Qwen 3.8 27BでBF16比99.63%の品質を13.1GB VRAMで実現
Shapelearn Qwen 3.8 27B (13.1 GB VRAM)
ByteShapeがQwen 3.8 27B向けのフルShapeLearn量子化モデルを公開した。5モデルすべてが品質と速度のフロンティア上に位置し、デフォルト推奨のGPU-5はBF16の総合スコアの99.63%を13.1GBのVRAMで達成する。小型のGPU-4も11.0GBで98.72%に達し、より高速だ。MTPやDFlash2による投機的デコーディングは全モデルでスループットを向上させる。
「GPU-5」は、収まるならどこでも私たちのデフォルトだ。90.4 tok/sでBF16ベースラインの99.63%に達する。
HNでの議論
36- _ache_
自分のテストから。
unslothモデルより速くはない。
開示: AMD GCでVulkanを使っている。
- syntaxing
私はstrix halo @ GPU-5でMTPを使って、600 prefillと30 TGが出るので、かなり実用的な範囲に入る。奇妙なのは、Dflash2が私には本当に遅く、TGが10未満みたいな感じ。
- Schlagbohrer
こういうグラフがあるウェブサイトは絶対的な宝だ、共有してくれてありがとう。自分のVRAMに合ったより速いモデル(より小さい量子化)を見つけるのに大いに助かった。
- npodbielski
まあ、同じプロンプトで7900XTXでテストしたけど、彼らのドラフトモデルでは約30t/sだった。通常のMTPモデルを使った彼らのコードスニペットでは60t/sだった。
それに、彼らのドラフトを使ったモデルは間違って答えた。
MTPだと正しく答えた。
質問は「MikroTik CRS312-4C+8XG-RMにはコンボポートがあるか?」だった。答えはYes。
- kristianp
GPU-5って何?