ByteShapeのShapeLearn、Qwen 3.8 27BでBF16比99.63%の品質を13.1GB VRAMで実現

Shapelearn Qwen 3.8 27B (13.1 GB VRAM)

ByteShapeのShapeLearn、Qwen 3.8 27BでBF16比99.63%の品質を13.1GB VRAMで実現

ByteShapeがQwen 3.8 27B向けのフルShapeLearn量子化モデルを公開した。5モデルすべてが品質と速度のフロンティア上に位置し、デフォルト推奨のGPU-5はBF16の総合スコアの99.63%を13.1GBのVRAMで達成する。小型のGPU-4も11.0GBで98.72%に達し、より高速だ。MTPやDFlash2による投機的デコーディングは全モデルでスループットを向上させる。

「GPU-5」は、収まるならどこでも私たちのデフォルトだ。90.4 tok/sでBF16ベースラインの99.63%に達する。
  1. _ache_

    自分のテストから。

    unslothモデルより速くはない。

    開示: AMD GCでVulkanを使っている。

  2. syntaxing

    私はstrix halo @ GPU-5でMTPを使って、600 prefillと30 TGが出るので、かなり実用的な範囲に入る。奇妙なのは、Dflash2が私には本当に遅く、TGが10未満みたいな感じ。

  3. Schlagbohrer

    こういうグラフがあるウェブサイトは絶対的な宝だ、共有してくれてありがとう。自分のVRAMに合ったより速いモデル(より小さい量子化)を見つけるのに大いに助かった。

  4. npodbielski

    まあ、同じプロンプトで7900XTXでテストしたけど、彼らのドラフトモデルでは約30t/sだった。通常のMTPモデルを使った彼らのコードスニペットでは60t/sだった。

    それに、彼らのドラフトを使ったモデルは間違って答えた。

    MTPだと正しく答えた。

    質問は「MikroTik CRS312-4C+8XG-RMにはコンボポートがあるか?」だった。答えはYes。

  5. kristianp

    GPU-5って何?

この日のほかの記事

2026-09-18