Grok 4.7、価格そのままで長時間コーディング能力が飛躍的に向上

Grok 4.7、価格そのままで長時間コーディング能力が飛躍的に向上

xAIがGrok 4.7を発表。Grok 4.6と同じ価格・速度ながら、より大規模な基盤モデルと長時間の強化学習により、難易度の高いコーディングや知識作業に強くなった。CursorBench 4.0では46.3%を記録し、GPT-5.6 SolやFable 5.1と比べて価格性能比で優位に立つ。安全性も新たなセーフガードスタックで強化され、危険なプロンプトの通過率を3.3%に抑えつつ、正当なセキュリティ業務を妨げない。

Grok 4.7は、これまでで最も強力なコーディングと知識作業のためのモデルです。難しいタスクに長時間取り組み、自身の作業をより注意深く検証し、これまでで最も調整されたセーフガードを備えています。
  1. moojacob

    どうやらGrok 4.7はGrok 4.6より40%も重みが多いらしいが、価格(出力トークン$6、入力$2)は同じだ。

    マージンが減っていること、そしてGrok 4.7のリリースを当初予定よりほぼ2週間遅らせたことを考えると、XAIは4.7の結果に満足していなかったに違いない。しかもXAIはOpus 5.5がリリースされると噂される前日に待っていた。Opus 5.5はベンチマーク的にGrok 4.7を粉砕するだろうと思う。

    しかし、私はベンチマークに対して懐疑的になっている。Grok 4.5はFable 5ができなかったbuildrootシステムのセットアップのいくつかの問題を解決した。ポストcursorのGrokはフロントエンドWeb開発で驚異的だと感じるが、ClaudeはバックエンドRubyではるかに優れている。

    新しいGrokのお気に入りの点は、平易な英語で話すことだ。私はClaudishが我慢ならない。GPTもそうだ。Claudeのような癖はないが、技術的概念の説明で手を抜くのが好きだ。それでも、説明に関してはClaude 3.5と4に勝るものはない。すべてのモデルが後退しているように見えるからだ。Grok 4.7もRLのせいで英語が後退するのだろうか。

  2. mchusma

    最初の印象では、Grok 4.6は私が試したどのユースケースでも実際には役に立たなかった。私のユースケース(コーディングと多数のエージェントワークフロー)にはある種の知能の床があるようで、Sol/Opusはその知能の床を超えている。

    4.7は間違いなく遅く、より高価だ。ベンチマークを這い上がるためにトークンを燃やさせたような感じだ。しかし、それがその線を超えているかどうかは私にはよくわからない。その一部は、あまりに遅いので今日はベンチマークで素早く進められていないことだ。

    全体として、私の知能の線を超えれば良いリリースだが...茶葉を読めば、Grokチームがこれは失敗だったと考えていることがわかる。

  3. vessenes

    このリリースケイデンスが上がり、品質が継続的に改善しているのを見るのは良いことだ。これらのモデルは基本的に、cursorチームが今所有する大量のコンピュートと統合した成果だと思う。チームがより経験を積み、大規模なトレーニング展開に自信を持てば、今年後半にgrok 5で大幅なステップアップが見られるだろう。もう一つの競争力のあるフロンティアモデルに期待しよう!

  4. jjcm

    画像→HTMLワークフローでは間違いなく良くなっている。Astra(現在これのSOTA)とGrok 4.7を比較したテストがこちらだ:

    デザイン:https://image.non.io/78795662-8bfc-4e14-8d72-3738392aa6b3.we...

    Astraのビルド:https://html.non.io/annui/

    Grokのビルド:https://html.non.io/Annui-grok/

    追加のプロンプト指示:「彫像の後ろに流れる雲を追加。マウス位置に基づいて彫像を動的にライトアップ。diffuiを使ってオブジェクトのノーマルマップ/デプスマップ/ラフネスマップを生成し、アセットを別々のレイヤーに分離せよ。」

    全体として、これらのモデルは画像を指示のソースとして従うのが上手くなっているが、出力の洗練度はモデル間で大きく異なる。Astraの最終出力はより洗練され、視覚的コントラストが良く、ページ間のアニメーションも滑らかだ。Grokは背景要素すべてをライトアップすることを選んだが、私には少しやり過ぎに思える。

    それでも、価格を考えれば素晴らしい出発点だ。

  5. simonw

    https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - デフォルトの推論レベル。

    推論レベルhighはこちら:https://tools.simonwillison.net/markdown-svg-renderer?url=ht...

    なぜか推論努力lowとmediumは同程度のトークン数を使い、xhighはhighより少なかった。間にOpenRouterを挟まずに試す必要があると思う。

    更新:xAI APIを直接使って再試行した:https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - 推論レベル間で大きな違いはなく、今回はなぜかxhighとlowが同じ数の推論トークンを使った。

    比較として、Grok 4.6に対する新規実行はこちら:https://tools.simonwillison.net/markdown-svg-renderer?url=ht...

  6. saejox

    Astraには全く及ばない。Astraは別格だ。高価だが、私のタスクでははるかに少ないトークンで済む。

    xAIはチャンスを逃した。ボールはAnthropicのコートにある。

  7. qwerpy

    私は4.6をいくつかの単発のゲームMOD/ユーティリティに使っているが、非常によくやってくれている。「私は非常にニッチなキーボード(Moonlander)を使っていて、この非常にニッチなスペースシムをプレイしている。それ用のSVGキーボードチートシートを作ってくれ」。キーボードのkeymap.cとゲームのキーバインドのinputmap.xmlを取得するように言われ、しばらく試行錯誤した後、かなり良い初回試作と、それを生成するのに使ったpythonスクリプトを吐き出した。さらに1時間やり取りしてスクリプトを改良し、今ではキーボードファームウェアとゲームのバインドが進化するにつれて適応する素晴らしい図を生成する:https://files.catbox.moe/x0u76x.svg

    4.7を試すのが楽しみだ。4.6で見られた「それはXではなくYだ」が修正されていることを願う。

  8. meerita

    Grokは本当に高価だ。DeepSeek 4.1 Flashを使ってはるかに安い価格で本当に素晴らしい結果を得ている。

  9. trentor

    どうやらまだキャッシュに問題があるようだ。キャッシュヒットの価格が他のプロバイダーの2倍... それが私の作業のほとんどなのに。:/

  10. sarjann

    なぜgrok 4.7 xhighをgrok 4.6 highと比較しているのか?

    同じトークン出力を出さない限り、4.7のモデル性能が良くないことを隠そうとしているように見える。

この日のほかの記事

2026-09-21