Qwen3.8-2.4T、オープンモデル初のQwen-Max級性能を公開
アリババのQwenチームは、オープンモデルとして初めてQwen-Max級の性能を備えたQwen3.8-2.4T-A95Bを公開しました。総パラメータ2.4T、活性化パラメータ95Bの大規模モデルで、コーディング、エージェント実行、長文コンテキスト処理で大幅な性能向上を実現。FP8量子化版も提供され、vLLMやSGLangなどのフレームワークで利用可能です。また、推論の深さを調整できるreasoning_effortや、過去の推論コンテキストを保持するpreserve_thinkingなどの新機能も搭載しています。
Qwen3.8は、Qwenオープンモデルファミリーの中でこれまでで最も高性能な世代です。
HNでの議論
12- UncleOxidant
我々が本当に待っているのは、2日後にリリースされる3.8-27Bだ。
- WalterGR
3時間前に投稿され、現在コメント63件: https://news.ycombinator.com/item?id=49273478
- xlayn
思うんだけど、ビッグラボや超巨大企業以外で、2.6TBのQ8を実行できるところはあるんだろうか?
つまり、1ビット版は508GBだろ。
256kのコンテキストサイズはこのサイズでは無関係として、1ビット版を実行するにはAMD 7900XTX(24GB VRAM)が22枚必要で、2.6TB版なら113枚だ。
113枚で、負荷がほぼ一定で、自分の2枚GPUマシンみたいにGPUが交代で動くと仮定すると、113GPU×113W=約11KW… その1インスタンスを保持して実行するだけで、冷却要件は神のみぞ知る…
たぶんMetaやGoogly、Claudyの誰かが「ああ、いいね、ダウンロードして実行しよう」って言うんだろうな。
Unslothの人は、あんなサイズのファイルをどうやって処理したんだ?