Claude Fable 5.1が首位、OpenAIが追う:Artificial Analysis Intelligence Index v4.2発表

Claude Fable 5.1が首位、OpenAIが追う:Artificial Analysis Intelligence Index v4.2発表

Artificial AnalysisがIntelligence Index v4.2を発表。エージェント型ナレッジワーク評価「AA-Briefcase」と、4,592ページのPDF文書を横断する推論テスト「GDP.pdf」を追加し、実世界の複雑なタスクを重視。さらに、評価のすり抜けを防ぐため非公開テストセットの比率を40%に引き上げた。結果、AnthropicのClaude Fable 5.1が首位、OpenAIのGPT-6 Astraが続く。GPT-6 Astraはトークン効率でも優位。

Index v4.2では、より複雑で現実的なタスクと、評価のすり抜けを防ぐ非公開テストセットを追加しました。
  1. throwaway13337

    Artificial Analysisがどうして誰かに真剣に受け止められるようになったのか、さっぱり分からない。これが彼らの新しいベンチマークセットなのか?

    彼らの新しいインデックスを一目見ただけで、彼らが何を測定しているにせよ、役に立たないことが分かる。

    Gemini 3.8と1時間過ごしてみて、あのモデルが2026年に属していると言えるかどうか試してみてほしい。あれはまるでアルツハイマー病にかかっているみたいだ。自分が読んだものが自分がやったことなのか混乱している。本当にめちゃくちゃひどい。

    Muse Spark 1.3は試したことがない。でも、1.2からあのランクに到達するには奇跡が起きたに違いない。

    どこかビデオゲームジャーナリズムの匂いがする。

  2. redox99

    AstraがSolと同じスコアなのはおかしいと彼らが気づいたので、人々の期待に合うようにインデックスを急いで更新したのだろう。

    以前のインデックスは明らかに悪かった(AstraはSolよりはるかに優れている)が、こうやって微調整するのも非科学的だ。

  3. jascha_eng

    個人的には、彼らのOmniscienceインデックスが、モデルの実際の有用性と最も高い相関を持つと思う。

    https://artificialanalysis.ai/evaluations/omniscience

    > 知識の信頼性と幻覚を測定します。正解には報酬を与え、幻覚にはペナルティを課し、回答拒否にはペナルティはありません。

    これは、モデルの出力を実際に信頼できるようにしてくれるので、とても有用だ。ベンチマークで高得点を取ることは、常に答えようとする過学習モデルが自信満々に間違った回答をする可能性があるため、それほど有用ではない。しかし、このインデックスは、間違った回答にペナルティを課しながら、どれだけ正解するかを測定するので、高得点は、このモデルをより信頼でき、知らないときは、でっち上げるよりも、本当に知らないと教えてくれる可能性が高いことを意味する。

    FableもここではOpus 5よりはるかに良いパフォーマンスを示しており、これは、例えばDeepSWEでは同程度のパフォーマンスを示しているにもかかわらず、知覚される強さと非常に強く相関している。

    AstraはSolから大きく飛躍し、ここではFableと同等かわずかに優れたパフォーマンスを示している。

  4. sanxiyn

    SciCodeのウェイトを8%から10%に引き上げたのは非常に残念だ。SciCodeは壊れたベンチマークだ: https://arxiv.org/abs/2608.04975 を参照。

  5. __jl__

    これは本当に素晴らしい成果だ:「Astraが出力トークンの最前線を支配」

    多くの研究所が、思考時間を増やしてベンチマークスコアとパフォーマンスを向上させてきた。中国のモデルの多くは、しばらくそれをやっていた。GoogleやAnthropicも同様だ。

    しかしOpenAIは違う。5.6はすでに他のモデルよりはるかにトークン効率が良く、AstraはSolをトークン効率で大きく上回っている。

    編集:要点を明確にするために:Astra(最大)は2番目に高いスコアを持ち、出力トークンは(AAが表示したモデルの中で)3番目に少ない。

この日のほかの記事

2026-09-05