Unsloth Dynamic 3.0:量化模型精度再提升

Unsloth Dynamic 3.0 GGUFs

Unsloth Dynamic 3.0:量化模型精度再提升

Unsloth 发布了 Dynamic v3.0 量化版本,在保持模型体积不变的前提下,将 Qwen3.8-27B 的 top-1% 准确率提升了超过 10%。此次更新引入了更高质量的 imatrix 校准数据集,覆盖 agentic coding、聊天及多语言场景,并优化了层选择策略。团队强调全程采用训练后量化(PTQ),拒绝 QAT 或 QAD,有效避免了过拟合问题。新的 Divergence-300 @32 和 KL Divergence 指标进一步验证了模型在推理轨迹上与 BF16 原版的高度一致性。无论是 llama.cpp 还是 Unsloth Desktop,用户都能体验到更精准、更高效的本地推理。

我们的 Dynamic v3.0 量化版本在相同体积下,比所有其他提供者高出 10% 以上的 top-1% 准确率。
  1. walrus01

    如果 Unsloth 发布的 GGUF 文件能带上版本号之类的标识就好了,不然我现在本地存储里就有好几个文件名完全一样的文件。

    比如 "Qwen3.8-27B-UD-Q8_K_XL.gguf"。

    至少 4 天前下载的那个版本和现在正在下载的 "Dynamic 3.0" GGUF 并不一样,我猜它们的 sha256 校验和应该不同?

    Unsloth 的页面说 Dynamic 3.0 是“今天”发布的,但我手头有一个旧版的 qwen3.8 27B Q8,如果我没记错的话,那是至少 4-5 天前下载的……

    https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

  2. Alephinitesimal

    我主要是在数据包含个人信息时使用本地模型。今年早些时候,我觉得本地模型的代码生成质量还是不如 Claude Code。

    对我有效的一种做法是:让本地模型生成一些格式相同的假数据,让 Claude Code 基于这些假数据工作,然后再把生成的代码拿回来,在本地用真实数据运行。

    这样真实数据就永远不会离开我的机器,但我依然可以利用更强的模型来完成大部分代码编写工作。

  3. spider-mario

    嘿 Unsloth,当我想下载 GGUF 模型时,你们发布的版本是我首选查找的目标。

    今天我其实是在尝试看看,Qwen3.8-27B 最小能压缩到什么程度还能跑出好结果,比如限制在 16GB 内存内。于是我选了 Qwen3.8-27B-UD-IQ2_XXS.gguf,结果 BAM,MTP 报错……看完你们的公告后我现在明白原因了。

    除了节省空间之外,为什么要移除 MTP?这恰恰是那些能从中受益的群体最需要提升速度的地方啊。

  4. xlayn

    有没有针对各种 Qwen3.8-27B 量化版本的基准测试,能实际测量代码生成能力的,甚至包含多步任务的?低 KL 散度如果模型老是陷入死循环,那也没多大意义。

    我当然可以自己下载测试,但以我的网速,那得花上好几天。

  5. johndough

    既然这似乎不仅减小了体积还提升了性能,我迫不及待想看到一些基准测试和对比数据。如果你没有单独的推理 GPU,那么每一 GB 内存都至关重要,所以针对特定 Q4 量化版本的对比对我来说非常有意思。

    目前我实在纠结:是选一个稍低一点的 Q4 量化版本来挤出一点缓冲和上下文空间,还是纠结于稍微高一点的版本(比如 IQ4_XS 对比 Q4_K_M/XL)是否值得?

同日更多故事

2026-08-19