GLM-5.3、Artificial Analysisの知能指数で最高峰に
GLM-5.3 Artificial Analysis Benchmarks
Artificial Analysisが公開したベンチマークで、GLM-5.3が知能指数のトップに立った。9つの評価(GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR)を統合したIndex v4.1.1で、コスト効率や出力トークン数、コンテキストウィンドウの詳細も分析されている。
AA-Omniscience Indexは、知識の信頼性と幻覚を測定し、正解を報酬とし、幻覚をペナルティとし、回答拒否にはペナルティを課さない。
HNでの議論
53- scotttrinh
コスト効率とトークン効率という、私が関心のある2つの指標を測れるので、タスクあたりのコストとタスクあたりの出力トークンが似ているモデル同士を比較するのが好きです。以下は、GLM-5.3を同程度のスコアの他のモデルと比較し、さらにGLM-5.2とも比較したものです。これらの指標に関心がある方のために、クリック数を減らしておきます。
モデル スコア タスクあたりのコスト タスクあたりの出力トークン
-------------------------------------------------------------------------
GLM-5.3 (max) 59.5 $0.68 41,107
GLM-5.2 (max) 53.0 $0.56 32,200
Claude Opus 5 (high) 61.5 $1.52 21,353
GPT-5.6 Sol (max) 60.9 $1.23 16,879
Grok 4.6 (high) 60.9 $0.84 21,735
Kimi K3 (max) 59.7 $0.84 25,474
GPT-5.6 Sol (xhigh) 59.0 $0.87 11,098
Claude Opus 5 (medium) 58.6 $0.98 12,459
Qwen3.8 Max 58.1 $1.13 38,287
Qwen3.8 2.4T A95B 57.7 $0.95 32,472
Claude Opus 4.8 (max) 57.3 $1.65 33,557
GPT-5.6 Sol (high) 57.3 $0.52 7,545
Muse Spark 1.2 (xhigh) 56.8 $0.40 30,430
GPT […]
- glub
GLM 5.3をリリース当日にテストしましたが、Artificial Analysisの評価は的確です。本当に良いモデルです。
しかし、私の主な収穫は別のところにありました。クローズドウェイトのモデルを長く使いすぎて、推論トークンを見ることの素晴らしさを忘れていました。
GPTやClaudeでは、意図がうまく捉えられたか、エージェントがすべての情報や必要なツールを持っていたかを願うしかありません。なぜなら、「nix flakeがここでは使えないし、グローバルにインストールすべきではないな」といったことは、何百万トークンも出力して8時間かけて何百ドルも無駄にするまで見えないからです。GLMのようなモデルでは、問題が始まったところで即座に止められます。
- Escapade5160
Solは過小評価されているモデルです。今日Claudeをやめてcodexに移行しました。Claudeが私に対して使っていたあのひどい散文はもうありません。
- BinRoo
記載されているベンチマークには注意してください。例えばSciCodeやEnterpriseOpsです: https://shukla.io/blog/2026-08/gym.html
- AnodicElegy
これらのベンチマークを実行するのは費用がかかることは理解していますが、AAには、少なくとも最大規模のリリースについては、最大以外の推論設定でのモデルのベンチマークをもっと含めてほしいと思います。コスト対複合ベンチマークスコアのグラフにパレート最適フロンティアの線がありますが、それが本当に最適な選択かどうかは誰にもわかりません。すでにパレート線上に、最大推論ではないモデルがいくつかありますが、テストされたのはそのうちのわずかです。