Qwen3.8-2.4T、オープンモデル初のQwen-Max級性能を公開

Qwen3.8-2.4T、オープンモデル初のQwen-Max級性能を公開

アリババのQwenチームは、オープンモデルとして初めてQwen-Max級の性能を備えたQwen3.8-2.4T-A95Bを公開しました。総パラメータ2.4T、活性化パラメータ95Bの大規模モデルで、コーディング、エージェント実行、長文コンテキスト処理で大幅な性能向上を実現。FP8量子化版も提供され、vLLMやSGLangなどのフレームワークで利用可能です。また、推論の深さを調整できるreasoning_effortや、過去の推論コンテキストを保持するpreserve_thinkingなどの新機能も搭載しています。

Qwen3.8は、Qwenオープンモデルファミリーの中でこれまでで最も高性能な世代です。
  1. UncleOxidant

    我々が本当に待っているのは、2日後にリリースされる3.8-27Bだ。

  2. WalterGR

    3時間前に投稿され、現在コメント63件: https://news.ycombinator.com/item?id=49273478

  3. xlayn

    思うんだけど、ビッグラボや超巨大企業以外で、2.6TBのQ8を実行できるところはあるんだろうか?

    つまり、1ビット版は508GBだろ。

    256kのコンテキストサイズはこのサイズでは無関係として、1ビット版を実行するにはAMD 7900XTX(24GB VRAM)が22枚必要で、2.6TB版なら113枚だ。

    113枚で、負荷がほぼ一定で、自分の2枚GPUマシンみたいにGPUが交代で動くと仮定すると、113GPU×113W=約11KW… その1インスタンスを保持して実行するだけで、冷却要件は神のみぞ知る…

    たぶんMetaやGoogly、Claudyの誰かが「ああ、いいね、ダウンロードして実行しよう」って言うんだろうな。

    Unslothの人は、あんなサイズのファイルをどうやって処理したんだ?

    https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF

この日のほかの記事

2026-08-12