Qwen 3.8-Flash-Next 明日公開、次世代Qwen4アーキテクチャを先行搭載
Qwen 3.8-Flash-Next releasing tomorrow (125B a6B)
AlibabaのQwenチームは、次世代Qwen4アーキテクチャをベースにしたマルチモーダルMoEモデル「Qwen3.8-Flash-Next」を2026年8月26日に公開すると発表。パラメータ数125B、アクティブ6Bのこのモデルは、今後のQwen4ファミリーに備えるための先行リリースとして位置づけられています。FP8版も同時に公開予定で、ModelScopeのページで入手可能になります。
Qwen3.8-Flash-Nextは、次世代Qwen4アーキテクチャに基づくマルチモーダルMoEモデルです。
HNでの議論
164- SwellJoe
ついに128GBのStrix HaloやGB10デバイスを買う理由ができた。あるいは新しいMac Studioを検討する理由もね。
私はStrix Haloとデスクトップに32GBのGPUを2枚持っているけど、後者の方がローカルモデルを動かすにはほぼ常に優れている。メモリ帯域幅が高い分、かなり速いからね。Qwen 27BやGemma 31Bより優れたモデルはこれまで単に存在しなかったし、それらは64GBで大きなコンテキストでも快適に動作する。
そして、MoEなら実用的な速度に近づくはずだ。
- ddtaylor
Qwenモデルはとても気に入っているが、OpenRouter経由でその上に構築するのは苦労が絶えない。
OpenRouterは素晴らしい仕事をしていて、異なるモデルをこんなに簡単に使えるのは本当にありがたい。プロバイダーが古いモデルを段階的に廃止するとき、それがまだ自分のニーズに合っていて価格もずっと安いと、とても嬉しい。まさにウィンウィンだと思う。
しかし問題は、多くのQwenモデルはキャパシティがほとんどないか、あまりに不安定で、文字通りコードにプロバイダーのブラックリスト/ホワイトリストを散りばめざるを得ないことだ。OpenRouterにはこれを解決しようとする試みがいくつかあるが、機能していない。実際、OpenRouterには文書化されたすごい機能がたくさんあるが、コードを読むと実装されていなかったり、実際にはまだ存在していなかったりする。それは残念だ。
この件でOpenRouterに連絡を取ろうとしたし、過去に彼らと協力したいと思ったこともあったが、適切な人に連絡するのは難しく、彼らは急速に成長している。Stripeに買収されることで、そうした問題が加速する面もあるだろう。いずれ彼らがすべての問題を解決してくれると確信しているし、あれだけ急速にスケールするのは本当に大変だから、彼らには拍手を送りたい。だが、ここまでの道のりはかなり退屈で、やる気を削がれた。
- notnullorvoid
これと、MoEモデルのCPU/RAMとGPU/VRAM間の分散処理を改善するFreeTokenのような推論エンジンとの交差点がどうなるか、興味深い。
競争力のあるモデルが中古の3090とDDR4メモリだけでローカルで快適に動くなら、今年はローカルAIの年になるかもしれない。
- fcanesin
- syntaxing
本当に楽しみだ。27BはStrix Haloでは苦労するし、Laguna 2.1はツール呼び出しでとんでもないことをやらかすからね。
- vegnus
M1 Max 64GBのMacBookを持っている。3.8 27Bを10トークン/秒以上で動かす方法はある?それとも諦めるしかない?3.6 a3bは良いけど、そこまで良くない。
- big-chungus4
> これらのアーキテクチャ改善を先んじて公開することで、コミュニティが今後のQwen4モデルフルファミリーに備えられるようにしています。
これは「フルファミリー」に4Bのような小規模モデルも含まれることを期待させる。
- Catloafdev
これがDeepseek v4 Flashとどう比較されるか非常に興味深い。もしこれより劣るなら、リリースしないだろうと思わざるを得ない。