Grok 4.6、インテリジェンス指数で61点を獲得し最前線に復帰

SpaceXAI's Grok 4.6 Scores 61 on the Artificial Analysis Intelligence Index

Grok 4.6、インテリジェンス指数で61点を獲得し最前線に復帰

SpaceXAIのGrok 4.6がArtificial Analysis Intelligence Indexで61点を獲得し、GPT-5.6 Solと並び、Anthropicに次ぐ最前線のモデルに返り咲いた。エージェント性能ではGDPval-AA v2でElo 1753を記録し、Claude Opus 5に次ぐ好成績。価格は$2/$6と据え置かれ、タスクあたりのコストは$0.84で、インテリジェンス対コストのパレート最適線上にある。長期的な知識作業ではAA-BriefcaseでElo 1577を達成し、Claude Opus 5の約半分のターン数で同等の成果を上げる。

Grok 4.6は、Claude Opus 5(max)の約半分のターン数と4分の1の入力トークンで同等の回答に到達するため、トークン単価をはるかに超えるコスト優位性を持ちます。
  1. mpalczewski

    Grok 4.5とGrok Buildをリリース直後から使っていて、Claudeはやめました。主に個人のコード用です。コミュニケーションが取りやすいんです。大したことないように聞こえるかもしれませんが、実は大きいんです。長文の壁を送ってくるのではなく、必要なことを教えてくれて、実際の判断は私がします。それに非常に速いので、セッションがはるかにインタラクティブになり、より頻繁に方向性を指示できます。CodexやSolとクロスチェックすることもありますが、日常的に使うのはGrokです。

    Claudeよりも生産性と成果が向上したと感じています。Claudeは私に仕事を与えているような感じでした。さらに、最近のClaudeの透かし問題を考えると、GrokかOpenAIを使いたいです。

    興味があるなら、Grok CLIをダウンロードしていくつかプロンプトを投げてみてください。驚くはずです。

  2. satvikpendem

    Cursorは、Grok 4.5以降、フロンティアレベルのモデルに対して信じられないほどお得なプランを提供していて、サブスクリプションがOpenAIやAnthropicよりもはるかに長持ちします。下位のプランでも、自社モデル(GrokとComposer)のトークンを大量に使えて、比較的枯渇しにくいです。オーケストレーターと実装者のような構成と組み合わせると、さらに効果的です。

  3. small_model

    SpaceXAIは、独自のコンピュート/データセンターと、まもなくチップ製造工場を持つ唯一のフロンティアモデル企業です。同等の知能でより安いトークン、より優れたハーネス/ツールを備えて、彼らが先頭に立つと思います。Grok Buildは、私の意見ではClaude Codeより2〜5倍速いです。

  4. dudeinhawaii

    Grokはかなり興味深いです。ほぼ毎日タスクの比較をしていますが、Grokは独自の存在で、良い意味でです。

    モデルの多様性があるのは良いことです。Sol、Terra、Lunaで同じタスクを実行すると、品質が低下しながら同じようなバリエーションが得られます。これではラインナップの意味がありません。Anthropicも同様です。Gemini-3.6-Flashと3.1 Proは実際に異なる動作をします。Opus 5とFableは…いとこ同士です。

    複雑な創造的な課題をテストしたいとき、4つの「ファミリー」から選べるのは、それぞれ異なる分野で優れているので、体験が面白くなります。

    Grokは独自の照明を実装するかもしれません。Opusはエレガントなプリミティブ、Solは1パスで正確な降雪、Geminiは滑らかな動き。組み合わせれば、最適なものを選べます。

    何と言っても、Grokはいつも「雑」ですが、仕上げます。ただし、Grok 4.6はもはや「賢くて速い」だけではありません。Solとほぼ同じ速さです。

    4.6で気づいた大きな改善点は、検証のためのツール使用です。以前は、Opus/Fableだけが、直接操作しにくいものを一貫してスクリーンショットしていました。今ではGrokはおそらくそのすぐ後ろで、視覚的に検証する傾向ではSolと同程度かもしれません。Grok 4.5はこれをあまり行いませんでした。

  5. pzo

    キャッシュ読み取りの価格が、Grok 4.5の$0.30からGrok 4.6では$0.50へとほぼ倍増したようです。

    私の経験では、ヘビーなコーディングセッションでは、請求のほとんどがキャッシュ読み取りとキャッシュ書き込みで、トークン請求の約80%を占めます。

  6. rd

    この競争に参加し続けるつもりなら、なぜAnthropicにコンピュートを売ったのか不思議に思っています。

  7. LZ_Khan

    これがフロンティアに到達するのがこれほど簡単なら、Geminiに強気になりますね。

  8. sidcool

    Grokは最高のモデルではありませんが、まともです。低価格で基本的な仕事をこなします。まだフロンティアの数学を前進させることはできないと思います。

  9. t1234s

    このスレッドでのClaude対GrokのSWEの言い争いを読んでいると、ずっと昔のIE対Netscapeの言い争いを思い出します。

  10. mchusma

    SpaceXがモデルのフロンティアに登場するのを見るのは嬉しいですね!彼らはしばらく追いかけていましたから。

この日のほかの記事

2026-08-12