ShapeLearn 让 Qwen 3.8 27B 性能再突破
Shapelearn Qwen 3.8 27B (13.1 GB VRAM)
我们之前发布的 ShapeLearn-Lite 版本表现已经不错,但全新的 ShapeLearn 完整模型更是将性能推向了新高度。在 Qwen 3.8 27B 的实测中,ShapeLearn 系列模型在六款 GPU 上均位于质量与速度的前沿。特别是 GPU-5 配置,在仅占用 13.1 GB VRAM 的情况下,达到了 BF16 基准分数的 99.63%。如果你需要更长的上下文或更快的速度,GPU-4 也是极佳选择。此外,结合 MTP 或 DFlash2 的推测解码技术,能进一步提升吞吐量。无论你的硬件配置如何,ShapeLearn 都提供了在速度与精度之间最优的平衡方案。
完整的 ShapeLearn 模型将实测的质量与速度前沿推向了 Lite 版本之外。
HN 评论区
32- _ache_
根据我自己的测试。
它并没有比 unsloth 模型更快。
声明:我在 AMD GC 上使用 Vulkan。
- syntaxing
我使用的是 strix halo @ GPU-5,搭配 MTP,prefill 能达到 600,TG 为 30,这已经让它进入了非常可用的范围。奇怪的是,Dflash2 对我来说真的很慢,TG 甚至低于 10。
- Schlagbohrer
这个网站真是宝藏,尤其是这些图表,感谢分享。这对我寻找适合我 VRAM 的更快模型(更小的量化版本)帮助巨大。
- npodbielski
我在 7900XTX 上用同样的提示词测试过,他们的 draft 模型给我大约 30t/s。而他们代码片段中使用的普通 MTP 模型给我 60t/s。
另外,用他们的 draft 模型回答时结果是错误的。
用 MTP 模型回答则是正确的。
问题是:“MikroTik CRS312-4C+8XG-RM 有组合端口吗?”答案是肯定的。
- kristianp
GPU-5 是什么?