Qwen 3.8 27B 登場:オープンウェイトで最強のローカル高密度モデル
Qwen 3.8 27B is out: open weights, best local dense model yet
Qwen 3.8-27B は、コーディング、エージェント実行、ビジョン理解などで大幅な性能向上を実現した、Qwen オープンモデルシリーズ最新の高密度モデル。FP8 量子化版が公開され、SGLang、vLLM、TokenSpeed などのフレームワークで利用可能。ネイティブな 262K のコンテキスト長(最大 1M まで拡張可能)と、画像・動画理解機能を備え、思考モードの柔軟な制御も可能。SWE-bench Pro や OSWorld-Verified などのベンチマークで、既存の Qwen モデルや他社モデルを上回る結果を記録している。
SWE-bench Pro では 61.7 というスコアを記録し、Opus4.6 Max の 53.4 を大きく上回りました。
HNでの議論
793- CMay
功績は認めるべきだ。Qwen 3.8 27B は、Gemma 4 に次いで、私のプライベートベンチマークの1つを正しく推論できた2番目のローカルモデルだ。それには5倍のトークン数と、MTPを有効にして12分30秒かかったが、確かにやり遂げた。
Gemma 4 はより暗黙的に推論したのに対し、Qwen 3.8 はより明示的に推論した。Laguna と Muse Glimmer はそれに惨敗したが、他のタスクには役立つ。
ただし、VRAM使用量は Gemma 4 や Glimmer よりはるかに非効率で、32Kのコンテキストで2.5GBのVRAMを使用する。それらでは、MTPやDFlashモデルをロードしても、256k〜768kのコンテキストを収めることができた。Qwen 3.8 27B では、VをQ4_0に量子化しても128kすら収まらない。試行錯誤すれば、より大きなコンテキストウィンドウで十分な性能を発揮する設定を見つけられるかもしれないが、長いタスクにはまだ使えるだろう。
まだテストすべきことは多いが、Muse Glimmer ではかなり良い結果が出ていた。それは2倍以上速く、巨大なコンテキストウィンドウをサポートし、Gemma 4 が苦戦したバグをいくつか解決できた。そのタスクを Qwen に投げることすらできない。なぜなら、プロンプトだけでコンテキストウィンドウ全体を使い切り、その後おそらく同じ量の推論をするからだ。
32GBのカードを持っているなら、メモリを大量に消費するとはいえ、十分なモデルだろう。
編集: いくつかのKVキャッシュ量子化設定を試したが、それらでは失敗した。このベンチマークはKLDや推論品質の低下に対してかなり厳しく設計しているので、それほど驚きではない。
- simonw
これは間違いなく、私のラップトップで動作するモデルから見た最高のペリカンだ: https://tools.simonwillison.net/markdown-svg-renderer#url=ht...
自転車の形は正しい。ペリカンのくちばしは素晴らしい。背景もいい。最も重要なのは、ペリカンが自転車の両側にそれぞれ1本の脚を置いていることだ。これは非常に珍しい。
(ただし、この自転車にはチェーンがない。推論トレースには「チェーンステーはもうある...チェーンの詳細は省略。小さなチェーンリングはあるかも」とある。)
私はこれをM5 Max MacBook ProでLM Studioとその17GB GGUFを使って実行した: https://lmstudio.ai/models/qwen3.8
21分(!)かかり、22,276の推論トークンを使って3,223トークンの出力を生成した。
(「彼らは今あなたのベンチマークでトレーニングしている」派の人たちのために言っておくと、そのカンニングはすべて、最初にタスクについて20分考えることを妨げなかった。共有したリンクで推論トレースを見ることができる。)
比較として、OpenRouterでqwen3.8-2.4t-a95bから得たものを紹介する。これは楽しくアニメーションする: https://tools.simonwillison.net/markdown-svg-renderer#url=ht...
- dexterlagan
モデルをいつもの評価で簡単にテストした: 小さなモデルがよく間違える一般知識の質問をいくつか、次にJSでフル機能のTODOリストアプリを書き、同じアプリをRustとTauriで書き直す。確かに、ほとんどのモデルは基本的なTODOアプリでよく訓練されているが、それによって私が基盤にできる基本的なSWE能力のアイデアが得られる。私にとっては、ローカルのgitリポジトリを正常にセットアップし、動作するTODOリストアプリのスケルトンを書くことができれば、それで十分だ。
SWE: モデルはサイズの割に強い。Webアプリは一発で成功し、バグはなかった。Rustの書き直しにはバグが1つだけあった(並べ替えがすぐに機能しなかった - 1つのプロンプトで修正)。ローカルにコミットしてからGitHubにプッシュした(https://github.com/DexterLagan/RusTODO)。文句はない。それが確実にできるなら、必要なものは何でも作るのに使える。
一般知識: 私はよく小さなモデルが間違える2つの質問をする: ジョン・キールの『トロイの木馬作戦』を要約し、出版年を答えよ。1994年のアリエル学校事件を要約せよ。Qwen3.8は最初の質問には正しく答え、出版年も正しく、キールの理論について素晴らしい詳細を与えたが、2番目は間違えた。学校はアメリカにあると思っていた。まあいいか。
性能(確かに過剰性能のラップトップでの話): このMacBook M5 Max 48GBで、省電力モードで15トークン/秒、パフォーマンスモードで30トークン/秒。OpenCodeを通じてローカルコーディングに完全に使える。
結論: 私の通常のGPT/Claude/DeepSeekに加えて、ローカルで無料のバックアップとして非常に優れている。Brave経由のWeb検索にも良い。
- dofm
思考の書き方に(3.6と比べて)本当の変化がある。「to」や「We need to」の「we」のような言葉を落とし、全体的にメモ形式で話し、あちこちで「the」や「and」を省略し、「for」を避ける。
「Need be helpful concise」、「Need maybe not overdo」、「Need ask!」まるで原始人のようだ。
私は(出典のない、漠然とした)疑念を持っているが、このかなりユニークな思考トレースパターンが、実際にMTP予測を妨げているのではないか。MTP予測は性能が悪いように見える。
他のメモ: 思考トレースでプロンプトを繰り返すトリックを使う。
また、最終回答に隠れた思考の連鎖が現れることを心配している。「望ましい冗長度9」について話しているが、これは新しい。少しGPTっぽい。
私のコードリクエストの1つを考えるのに非常に徹底しているが、最終結果が35B MoEより良くなるかどうかはわからない。
明確化の質問をするように頼んだら、実際に質問し、単に同意できるデフォルトのリストを提供してくれた。
必ずしもループする意味での過剰思考ではないと思うが、網羅的という意味では過剰思考だ。より厳しい推論予算でどう機能するかを探る必要がある。
感銘を受けたが、私は間違いなく「Please-35B-A3B-When?」キャンプにいる。M1 Maxではこれは実際には実用的ではないからだ。彼らが作ってくれることを願っているが、作らないかもしれないと思う。
- satvikpendem
いつものように、Jinjaテンプレートが壊れているので、これ[0]を使って思考を減らすかオフにし、ツール呼び出しを修正し、KVキャッシュヒット率を100%に保つなどしてください。
[0] https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates
- Casteil
Qwenを誇大宣伝するときに多くの人が考慮していないことの1つは、このようなモデルが、終わりのない「二度目の推測」で「考えすぎる」傾向があることだ。3.8も、私がこれまで試した限りでは同じようだ。
能力は高いが、競合モデル(例: Gemma4:26b-a3b)が同じまたは同様の応答を、思考トークンが1/10で、はるかに高いトークン/秒を達成し、時間もほんの一部で一貫して達成できる場合、それを使う正当性は難しい。ユースケースによって「結果は異なる」と思う。
また、無限ループに陥りやすいかどうかを確認するほどまだ使っていないが、前モデルは確かにそうだった。
- kimsey0
他の誰かがこれをRTX 5090で実行しているなら、推論エンジンとしてhttps://github.com/Neroued/ninfer を使うと、私の環境では約138トークン/秒が得られる。これは素朴なllama.cppセットアップの約2倍だ。
- onlyrealcuzzo
ベンチマークが嘘をついていなければ、これはOpus 4.6の能力に非常に近づいている。Opus 4.6は、AIが「十分に良く」なり、それを使わないことを正当化するのが非常に難しくなった転換点だった。
ベンチマーク狙いの調整がいくつかあるだろうし、より大きなモデルでしか得られないものもあるだろう。
しかし、Gemma 5までではないにしても、2028年半ばまでには、ほぼ常にOpus 4.6と同等か、多くの場合はるかに優れたローカルモデルが登場すると確信している。
- LeBit
- jjcm
このモデルのImage->htmlテスト。
元画像: https://image.non.io/neonRamenDesigns.webp
Qwen 3.8ビルド: https://html.non.io/neonRamenQwen3.8-27b
全体的に、これがどれだけうまくできたかに非常に感銘を受けた。3.6からの大きな改善であり、はるかに大きなモデルと同等に感じる。これはGemini 3.7 Flashと同等だと思う。
1つ注意点: 私のRTX 6000 Pro Blackwellでのこのビルドには長い時間がかかった。これまでで最も長いビルドの1つだ。サイトの構築に約2時間かかった。すぐにこれを高速化する量子化バージョンが出るだろうが、それでも時間がかかったことに驚いた。
今週の比較ビルド:
https://html.non.io/neonRamenGemini3.7
https://html.non.io/neonRamenGLM5.3 (注: 非マルチモーダル)