オープンウェイトのGLM-5.3がAnthropic/OpenAIモデルを打ち負かす——コストは5分の1
GLM-5.3 (open-weight) beat Anthropic/OpenAI models – for 1/5 the cost

Ed Yau氏が設計した「Ed-o-meter」ベンチマークで、17の主要LLMを同一の28タスクで評価。オープンウェイトのGLM-5.3が100%の合格率、ルーブリックスコア9.3、総コスト0.28ドルでトップに立ち、GPT-5.5の約5分の1のコストで全カテゴリをクリアした初のモデルとなった。一方、fable-5とopus-5はタスク拒否が目立ち、gpt-5.6シリーズはセキュリティに脆弱。コスト重視ならgpt-5.6-luna、速度重視ならhaiku-4-5が推奨される。
同じドライバー、同じコース。LLMこそがスターだ。
HNでの議論
110- hellohello2
これは全体がClaudeが生成したようにすぐに読めてしまい、真剣に受け取るのが難しい。
なぜこれらの結果は、LLMのベンチマークに関する既存の真剣な試みと矛盾するのか?すなわち:
- jchw
ほぼ10のモデルが95%以上のベンチマークを通過している——それはかなり過飽和ではないか?
また、どのHaikuモデルも非常に高い位置にあるベンチマークにはかなり懐疑的だ。私はHaikuに完全に感銘を受けておらず、基本的に使うべきではないという意見だ。しかしここでは、Kimi K3と同等だ。うーん。
「Rubric Quality」は「Pass Rate」より少し現実的だが、明らかにFable 5によって判定されているようだ。
この記事全体も明らかにAI支援がかなり強く、事態を悪化させている。
- gertlabs
問題の一つは、1回30ドルというのは、多くの検証可能なタスクではかなりノイズが多いことだ。私たちの評価では、GLM 5.3の価格帯のモデルでは通常、少なくとも1桁以上多く実行する。
私たちはちょうどGLM 5.3の結果をマルチエージェントコーディング評価で公開したが、確かに印象的なモデルで、約6位だ。価格を考えると、実際にはパレート最適ではなく、Grok 4.6(より速く、同じ価格)とSol 5.6(同等の結果に対してはるかに少ない思考トークンを使用)にわずかに遅れを取っている。多くの中国製モデルと同様に、ハーネス内での反復に優れている一方で、最初の回答/基礎となる流動的知能はアメリカの最先端モデルより下だ。
データは https://gertlabs.com/rankings にあります。
- iamcoder18
GPT 5.5がGPT 5.6 Solより優れているなんてありえないし、gemini-3.6-flashがその両方より優れているなんてありえない。このベンチマークは全く信頼できない。
- solenoid0937
わからないけど、私は毎日オープンモデルを個人プロジェクトで使い、クローズドモデルを仕事で使っている。
オープンモデルはすべて明らかにFableよりはるかに遅れており、Opusからもかなり遅れている。これらの投稿はすべて、動機づけられた/希望的観測のように読める。
人々がオープンフロンティアがクローズドフロンティアと同じ場所にあることを強く望んでいるのは理解できるが、実際にモデルを実際のプロジェクトで使ってみれば、明らかにそうではない。
- ac29
Haikuがほぼ完璧なスコアを取り、Fableが最下位タイというベンチマークは信頼できない。
- Klaster_1
先週、私はGLM-5.3の助けを借りてデバイスのリバースエンジニアリングに深く没頭していたが、それは私の期待をすべて超えた——実際、思っていたよりもはるかに多くのことを達成できた。私はこれまでそんな低レベルのことに取り組んだことがなく、ARMアセンブリを学び、脆弱性を見つけてエクスプロイトを書くには何ヶ月もかかっただろう。最初はClaudeで試したが、最初のメッセージでブロックされたので、返金してもらい、z.aiを試すことにした。唯一の欠点は、昼間の仕事で使っているOpusより少し遅いかもしれないことと、週間制限に数日でぶつからないように月額プランに約200ユーロ支払わなければならなかったことだ。このレベルの能力が50ユーロくらいなら、長期サブスクリプションを強く検討するだろう。
- CMay
> 1つのモデルを実行するなら、glm-5.3を実行せよ
これはひどい結論だ。たった28タスクで、ほとんどのモデルの合格率が高いというのは、ほとんど何も示していない。
自分のユースケースでモデルをテストし、ユースケースを100%満たす最速・最小・最安のモデルを使うべきだ。
あるいは、本当に強い汎用性能を持つモデルが必要なら、このような限られたタスクセットのベンチマークを真剣に受け取ってはいけない。