Unsloth Dynamic 3.0 GGUF量子化、同サイズで精度10%以上向上
Unsloth Dynamic 3.0 GGUFs

Unslothは、Dynamic量子化の次世代版「Dynamic v3.0」を発表。Qwen3.8-27B向けの新しいGGUF量子化モデルは、同じディスク容量で他社製よりトップ1%精度が10%以上向上し、llama.cppやUnsloth Desktopなどの推論エンジンで動作します。高品質なimatrixキャリブレーションデータセットと改良されたレイヤー選択により、モデル品質を維持しつつ、KLダイバージェンスなどの指標で優れた結果を示しています。また、小容量量子化ではMTPモジュールを削除してディスク容量を節約し、UD-IQ1_Sは6.2GBでトップ1%精度の約72%を維持します。
Unsloth Dynamic v3.0は、同じサイズで他のどのプロバイダーよりもトップ1%で10%以上優れた精度を実現します。
HNでの議論
117- walrus01
Unslothが公開しているGGUFにバージョン番号か何かを付けてくれると嬉しいんですけどね。今、ローカルストレージにまったく同じ名前のファイルが複数あって困ってるんです。
例えば「Qwen3.8-27B-UD-Q8_K_XL.gguf」とか。
少なくとも4日前にダウンロードしたものは別物で、今ダウンロードしている「Dynamic 3.0」GGUFとは違うんですよね。sha256チェックサムも違うんでしょうね?
UnslothのページにはDynamic 3.0が「本日」リリースされたとありますが、私はQwen3.8 27B Q8の古いコピーを、確か4〜5日前にダウンロードした記憶があります…
- Alephinitesimal
私は主に、データに個人情報が含まれる場合にローカルモデルを使っています。今年の初め、コーディング品質はまだClaude Codeほど良くないと感じていました。
私にとってうまくいっている方法の一つは、ローカルモデルに同じ形式のダミーデータを作らせ、Claude Codeにそのダミーデータで作業させ、その後コードをローカルに持ち帰って実際のデータで実行することです。
こうすることで実際のデータが私のマシンから出ることはありませんが、それでもコーディングの大部分にはより強力なモデルを使うことができます。
- xlayn
ねえUnsloth、GGUFモデルをダウンロードするとき、まずあなたのGGUFを探しますよ。
今日まさに、Qwen3.8-27Bで、例えばRAM 16GBに制限して、実行して良い結果が得られる最小のものは何か、確認しようとしていました。それで、Qwen3.8-27B-UD-IQ2_XXS.ggufを選んだら、MTPでエラーが… あなたの発表を読んで理由がわかりました。
スペースの節約以外に、なぜMTPを削除するのですか? まさにその恩恵を受けられるグループにとって、速度が向上するのに。
- johndough
Qwen3.8-27Bの様々な量子化バージョンについて、実際にコードを書くことを測定したベンチマーク、できれば複数ステップのものはありますか? モデルが延々とループに陥る場合、KLダイバージェンスが低いことはあまり意味がありません。
もちろん自分でダウンロードしてテストすることもできますが、私のインターネット接続では何日もかかるでしょう。
- throwa356262
「また、UD-IQ1_Sが6.2GB(MTPなし)の小さなUD-1bit量子化も作成しました。これは約72%のtop-1%精度を維持しつつ、89%小さくなっています」
これはすごい! でも、これらの低い量子化を実際のプロジェクトで試した人はいますか?
- Systemerror7A69
サイズだけでなく性能も向上したようなので、ベンチマークや比較が待ちきれません。推論用に別のGPUを持っていない場合、1GBごとが重要なので、特定のQ4量子化の比較はとても興味深いです。
現在、少し低いQ4量子化にしてバッファやコンテキストを少し増やすか、それとも少し高いもの(IQ4_XS vs Q4_K_M/XL)にする価値があるかを非常に迷っています。
- jjcm
見たところ、まだDynamic 3.0のNVFP4量子化はないようです。念のため。カーブ上の他のものと比較して、それらがどう機能するか見てみたいです。
- mike-the-brain
的外れかもしれませんが:Appleデバイスでこのような量子化を行うことは可能でしょうか? Mac Studio Ultra M1のようなもので(たとえ数週間/数ヶ月かかるとしても)?