ShapeLearn 让 Qwen 3.8 27B 性能再突破

Shapelearn Qwen 3.8 27B (13.1 GB VRAM)

ShapeLearn 让 Qwen 3.8 27B 性能再突破

我们之前发布的 ShapeLearn-Lite 版本表现已经不错,但全新的 ShapeLearn 完整模型更是将性能推向了新高度。在 Qwen 3.8 27B 的实测中,ShapeLearn 系列模型在六款 GPU 上均位于质量与速度的前沿。特别是 GPU-5 配置,在仅占用 13.1 GB VRAM 的情况下,达到了 BF16 基准分数的 99.63%。如果你需要更长的上下文或更快的速度,GPU-4 也是极佳选择。此外,结合 MTP 或 DFlash2 的推测解码技术,能进一步提升吞吐量。无论你的硬件配置如何,ShapeLearn 都提供了在速度与精度之间最优的平衡方案。

完整的 ShapeLearn 模型将实测的质量与速度前沿推向了 Lite 版本之外。
  1. _ache_

    根据我自己的测试。

    它并没有比 unsloth 模型更快。

    声明:我在 AMD GC 上使用 Vulkan。

  2. syntaxing

    我使用的是 strix halo @ GPU-5,搭配 MTP,prefill 能达到 600,TG 为 30,这已经让它进入了非常可用的范围。奇怪的是,Dflash2 对我来说真的很慢,TG 甚至低于 10。

  3. Schlagbohrer

    这个网站真是宝藏,尤其是这些图表,感谢分享。这对我寻找适合我 VRAM 的更快模型(更小的量化版本)帮助巨大。

  4. npodbielski

    我在 7900XTX 上用同样的提示词测试过,他们的 draft 模型给我大约 30t/s。而他们代码片段中使用的普通 MTP 模型给我 60t/s。

    另外,用他们的 draft 模型回答时结果是错误的。

    用 MTP 模型回答则是正确的。

    问题是:“MikroTik CRS312-4C+8XG-RM 有组合端口吗?”答案是肯定的。

  5. kristianp

    GPU-5 是什么?

同日更多故事

2026-09-18