Qwen3.8 27B、Artificial Analysisでインテリジェンス指数52を記録

Qwen3.8 27B scores 52 on Artificial Analysis

Qwen3.8 27B、Artificial Analysisでインテリジェンス指数52を記録

Artificial Analysisのインテリジェンス指数で、Qwen3.8 27Bがスコア52を獲得しました。この指数は、GDPval-AA v2やGPQA Diamondなど9つの評価を統合したもので、モデルの知識信頼性や幻覚率も測定します。オープンウェイトモデルとして、コストパフォーマンスやトークン使用量、コンテキストウィンドウ、パラメータ数などの詳細な分析も提供されています。

インテリジェンス指数は、正解を報酬とし、幻覚を罰し、回答拒否にはペナルティを課さない、知識の信頼性と幻覚を測定する指標です。
  1. beltsazar

    比較として、Qwen3.6 27Bは38を記録しており、これはスモールモデルカテゴリー(4B〜40B)で最高でした。

    Qwen3.8 27Bはすべてのミディアムモデル(40B〜150B)を上回ります。これは、ラージモデルカテゴリー(>150B)で5位のDeepSeek V4 Flash 0731と同じスコアです。

    出典:

    - https://artificialanalysis.ai/models/open-source/small

    - https://artificialanalysis.ai/models/open-source/medium

    - https://artificialanalysis.ai/models/open-source/large

  2. Balinares

    そしてまたしても、Qwen 3.8 27BがOpus 4.6を打ち負かすなんて、一体全体どういうことだ。

    面白いと同時にちょっと恐ろしくて、まだ信じられない。ゲーミングPCで十分に動くんだぞ! Opus 4.6はたった6ヶ月前に出たばかりで、当時は誰もが新しいSOTAだと認めていたのに、しかもかなりの差をつけて! 2026年2月のフロンティアSOTAに匹敵する能力を、どうやって27Bに詰め込んだんだ?!

    もっと重要なのは、数年前のGPUで十分すぎるほど良いモデルが動くのに、前例のない借金をして巨大なデータセンターを建設する意味があるのか?

    今後数ヶ月は本当に楽しみだ。それは間違いない…

  3. x313

    週末にこれをたくさん使ったが、本当に知的で奇妙なモデルだ。

    高い推論レベルでは、本当にエージェント的になる。目標追跡やツール呼び出しといった基本はしっかりやるが、それ以上に、問題解決に執着し、解決策にたどり着くために非常識で異常なことをする。実際、同じく執着的なGPT-5.6-Sol-maxを思い出させる。

    Opus 4.6を上回るスコアを出したことにはまったく驚かない。Opusは世界知識はずっと優れていたが、エージェント的なことはより「人間らしく」、いわば怠惰で創造性に欠け、明白な解決策が失敗すると基本的に諦めてしまった。これらの新しいモデルは魔法のように機能し、解決策を見つけるための創造性と粘り強さに満ちている。

  4. K0IN

    私はQwen 3.6 27Bを広範囲に(>10億トークン)使用し、DeepSeek V4 Flash(古い方も20億+トークン)も使用しました。

    そして、新しい3.8が新しいDeepSeek V4 Flash(私の目には、日常的なコーディングに最適なモデルの一つ)を上回るとは、まったく理解できません。

    なんて狂ったリリースだ、そして毎日/ローカルで使うのに便利なサイズだ。

    しかし、このモデルを徹底的にテストするつもりだ。

  5. kmike84

    私は自分のワークフローにほぼ沿った内部の自動ベンチマークを持っており、ローカルとクラウドのさまざまなモデルでテストしてきた。Qwen 3.8 27Bは素晴らしかった。理解は正確で、リサーチは例えばGLMより優れており(GLMも好きだが)、実装は良く注意深い。

    Qwen 3.8 27Bはベンチマックスされているようには見えない。この「52 AAスコア」という数字は本物に感じられ、驚きだ。ここ数日、他のタスクでもローカルで使っている。スピードさえ気にならなければ、クラウドモデルの代わりに日常的に使ってもまったく満足できるほど良い。

    ---

    (ベンチマークの概要)

    1. まず、あまり精密ではない初期プロンプト - 例えばOpusに話すときのようにタスクを書く。アイデアを説明し、計画を考え、アプローチを批判するようモデルに求める。タスクは特定のpi拡張機能の実装に関するもの。モデルが私の質問を実際に理解しているか確認する。

    2. 次に、フォローアップとして、代替実装のリサーチ、類似拡張機能のUXリサーチなどを依頼する。ウェブ検索、オープンソースコードベースの調査、記事や論文の読解などが必要。これを正確に指示するわけではないが、良いモデルならそれが必要だと理解するはず。

    3. そして実装。

    また、ひとつの発見:Q4とQ8はこのベンチマークで非常に異なる挙動を示す。Q4は最後に2〜3倍の思考を生成し、より多くのターンを行う - より多くの間違いを犯し、そこから回復する努力が必要のようだ。一方、Q8はより多くのことを正しく行う […]

  6. padolsey

    フロンティアに近いこれらのモデルが小さくなればなるほど、https://en.wikipedia.org/wiki/Lottery_ticket_hypothesis を思い出させる。

  7. anana_

    さらに文脈を加えると、これはGLM 5.2やGPT 5.6 Lunaなど、はるかに大きなモデルと同等の性能だ。

  8. f311a

    なぜこんなに小さいのに、高価なのか?

    Open Router

    入力 /M $0.45

    出力 /M $3.20

    キャッシュ読み取り /M $0.05

    スループット 27 tps

    200〜300 tpsで、非常に安ければ、とても素晴らしいモデルになるだろう。

    推論プロバイダーが速度と価格を最適化する際の制限要因は何か?

この日のほかの記事

2026-08-17