GLM-5.3、Artificial Analysisの知能指数で最高峰に

GLM-5.3 Artificial Analysis Benchmarks

GLM-5.3、Artificial Analysisの知能指数で最高峰に

Artificial Analysisが公開したベンチマークで、GLM-5.3が知能指数のトップに立った。9つの評価(GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR)を統合したIndex v4.1.1で、コスト効率や出力トークン数、コンテキストウィンドウの詳細も分析されている。

AA-Omniscience Indexは、知識の信頼性と幻覚を測定し、正解を報酬とし、幻覚をペナルティとし、回答拒否にはペナルティを課さない。
  1. scotttrinh

    コスト効率とトークン効率という、私が関心のある2つの指標を測れるので、タスクあたりのコストとタスクあたりの出力トークンが似ているモデル同士を比較するのが好きです。以下は、GLM-5.3を同程度のスコアの他のモデルと比較し、さらにGLM-5.2とも比較したものです。これらの指標に関心がある方のために、クリック数を減らしておきます。

    モデル スコア タスクあたりのコスト タスクあたりの出力トークン

    -------------------------------------------------------------------------

    GLM-5.3 (max) 59.5 $0.68 41,107

    GLM-5.2 (max) 53.0 $0.56 32,200

    Claude Opus 5 (high) 61.5 $1.52 21,353

    GPT-5.6 Sol (max) 60.9 $1.23 16,879

    Grok 4.6 (high) 60.9 $0.84 21,735

    Kimi K3 (max) 59.7 $0.84 25,474

    GPT-5.6 Sol (xhigh) 59.0 $0.87 11,098

    Claude Opus 5 (medium) 58.6 $0.98 12,459

    Qwen3.8 Max 58.1 $1.13 38,287

    Qwen3.8 2.4T A95B 57.7 $0.95 32,472

    Claude Opus 4.8 (max) 57.3 $1.65 33,557

    GPT-5.6 Sol (high) 57.3 $0.52 7,545

    Muse Spark 1.2 (xhigh) 56.8 $0.40 30,430

    GPT […]

  2. glub

    GLM 5.3をリリース当日にテストしましたが、Artificial Analysisの評価は的確です。本当に良いモデルです。

    しかし、私の主な収穫は別のところにありました。クローズドウェイトのモデルを長く使いすぎて、推論トークンを見ることの素晴らしさを忘れていました。

    GPTやClaudeでは、意図がうまく捉えられたか、エージェントがすべての情報や必要なツールを持っていたかを願うしかありません。なぜなら、「nix flakeがここでは使えないし、グローバルにインストールすべきではないな」といったことは、何百万トークンも出力して8時間かけて何百ドルも無駄にするまで見えないからです。GLMのようなモデルでは、問題が始まったところで即座に止められます。

  3. Escapade5160

    Solは過小評価されているモデルです。今日Claudeをやめてcodexに移行しました。Claudeが私に対して使っていたあのひどい散文はもうありません。

  4. BinRoo

    記載されているベンチマークには注意してください。例えばSciCodeやEnterpriseOpsです: https://shukla.io/blog/2026-08/gym.html

  5. AnodicElegy

    これらのベンチマークを実行するのは費用がかかることは理解していますが、AAには、少なくとも最大規模のリリースについては、最大以外の推論設定でのモデルのベンチマークをもっと含めてほしいと思います。コスト対複合ベンチマークスコアのグラフにパレート最適フロンティアの線がありますが、それが本当に最適な選択かどうかは誰にもわかりません。すでにパレート線上に、最大推論ではないモデルがいくつかありますが、テストされたのはそのうちのわずかです。

この日のほかの記事

2026-08-18