GLM-5.3、オープンウェイト最強のコーディングモデルに——脆弱性発見で驚異の進化
GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Z.aiがGLM-5.3をリリース。ポストトレーニングのスケーリングのみで、コーディングと長期的タスクで大幅な性能向上を達成。オープンウェイトモデルとして最高水準のコーディング性能を誇り、脆弱性発見・悪用チェーンで特に顕著な進歩を見せた。Terminal Bench 3.0で4.6→28.3、DeepSWE v1.1で46.2→66.9、ExploitBenchで24.4→54.4と、いずれも倍以上のスコアアップ。さらに、実世界のコードベースで2,436件の脆弱性を発見し、そのうち1,097件が重大・高 severity。セキュリティ開示台帳も公開。ウェイトは安全性評価完了後の2週間後に公開予定。
スケーリングに伴い、サイバー能力は予想以上に速く発展した。GLM-5.3は単に孤立した欠陥を特定するのが上手くなったわけではなく、悪用の複数段階にわたって推論し、完全な悪用チェーンのための首尾一貫した計画を立て始めたのだ。
HNでの議論
584- leobuskin
昨日、GLM公式サブスクリプション(5.2版だが、新しいモデルバージョンはすでに一部のドキュメントにリークしていた)を18ドルで購入し、Claude Codeハーネスで設定した...そして、ほぼ即座に80ドルプランにアップグレードした。これは、適切なセキュリティ調査(レッドチームシナリオ)に同意し、それをシームレスに実行した最初のモデルだ。WPプラグインのゼロデイ、RCE、6.8カーネルエクスプロイトの適応などを含む。さらに、別のGLMエージェントを防御側として対戦させながら(HFのストーリーに従って)実行した。
このようなモデルが悪意のある攻撃者に利用される可能性は理解しているが、それが公開されているのは公平だと思う(そして緊急時には自分の側で使える)。これは世界をより良く変えるものだと思う。ガードレールではなく。
- z4y5f3
どうやら彼らはOSSや人気ソフトウェアを大規模にスキャンし、見つけた脆弱性を開示しているようだ: https://cvd.z.ai/
これらのほとんどはまだ開示保留中だが、広範囲の人気ソフトウェアからのCVEが多数あり、その多くが重大または高と見なされているようだ。
「人々は積極的に探していない」という主張は理解できるが、そのようなスキャンのコストは毎週下がっているし、AnthropicのProject Glasswingはかなり前にそれらを見つけるはずではなかったのか?
- aliljet
これはまだSolやFableには及ばないが、ほんの僅差だ。驚異的な結果だ。OpenAIを捨てる経済的な理由はまだない(起こった荒唐無稽なリセット中毒のおかげで)が、崖っぷちに立っているように感じる。
皆さんは、この種のものをローカルでメガ量子化して実行する方法をどう弄っている? 重みの公開から2週間だが、これはまだポストトレーニングの魔法がかかったGLM 5.2に過ぎない。
- hypfer
もしかしたら私は自分のポジティブバイアスをそのテキストに読み込んでいるだけかもしれないが、それはシリコンバレーのマーケティングの誇大広告というより、研究者が書いたように見える可能性はあるだろうか?
それは私と私の時間の両方を尊重しているように感じる。
ありがとう、Z.AI。
組織のトップが実際の大学教授であると、どれほどの違いが生まれるか驚かされる。
- aand16
> Mythos 5は181タスクと247タスクで依然として大きく先行している。3つのパターンは一貫している: エクスプロイトチェーンの上流にベンチマークがあるほど、クローズドフロンティアとの残りのギャップは広がる。能力は、私たちが最も遅れているところで最も速く成長している。
彼らが自己賛美の機会を利用しないことを評価する。
- jjcm
Gemini 3.7 flashスレッドで示したのと同じ画像→HTMLテスト。GLMはマルチモーダルではないが、それでもPythonスクリプトを書いて画像を検査し、要素を抽出することで、似たようなものを生成することができた。
元の画像: https://image.non.io/neonRamenDesigns.webp
GLM 5.3ビルド: https://html.non.io/neonRamenGLM5.3
比較用のOpus 5ビルド: https://html.non.io/neonRamen
視覚がないにもかかわらず、素晴らしい仕事をした。これほど多くの詳細を抽出できたことにかなり感銘を受けた。
Opusの方がまだかなり優れているが、マルチモーダルなのでそれは予想通りだ。Z.aiの将来のバージョンがこれでどうなるか興味がある。
- wxw
> ポストトレーニングのスケーリングだけがGLM-5.3で行ったすべてだ。
このオープニングラインが大好きだ。そして、すごい結果だ。
> エージェントの能力が向上するにつれて、ポストトレーニングのスケーリングの難しさの多くはモデルから環境へと移る。
- bertili
これはKimi K3とほぼ同等になるだろうが、パラメータはその3分の1だ。
わずか4週間前、「Kimi K3モーメント」はクローズドAIへの脅威と見なされていたが、1ヶ月も経たないうちにZ.aiはパラメータ/RAMの壁を3分の1に削減した。
Z.aiと、静かに蛙を茹でているすべての勤勉な中国の研究者たちにおめでとう。
- virgildotcodes
OpenAIとAnthropicは、人々にサイバーモデルへのアクセスを与えるべきだ。
そうでなければ、攻撃者がオープンソースとクローズドソースのモデルを、AnthropicとOpenAIに大きく依存している可能性が高く、今月のオープンモデルを使い始めるための承認を得るのが簡単ではないかもしれない、はるかに少数のメンテナーのグループに対して使用する世界になる。
- vmware508
Appleは来年、M7 MacBook Pro / Mac miniをリリースするだろう。そしてそれらは、無料のLLMをローカルでネイティブ速度で実行できるようになるだろう。すべてのソフトウェア開発者のノートパソコンは、ローカルモデルを実行するために置き換えられ、Claude Codeのサブスクリプションをキャンセルすることで多くを節約できるだろう。
開発者が勝つ。Appleの株は急騰するだろう。他のすべては下がるだろう。どういたしまして。