Claude Opus 5.5、知能・性能・価格を徹底分析
Claude Opus 5.5 Intelligence, Performance and Price Analysis
Artificial AnalysisがClaude Opus 5.5を独自のIntelligence Index v4.3.2で評価。10種類のベンチマークを用い、知能指数とタスクあたりコストの関係を分析している。さらに、キャッシュヒット・入力・出力の価格、コンテキストウィンドウ、出力トークン数なども比較可能だ。
AA-Omniscience Indexは知識の信頼性とハルシネーションを測定する。正解には報酬を与え、ハルシネーションにはペナルティを課し、回答を拒否してもペナルティはない。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が正解より多いことを示す。
HNでの議論
69- simonw
これは「max」推論設定のページです。xhighのページは https://artificialanalysis.ai/models/claude-opus-5-5-xhigh で、medium(デフォルト設定)のページは https://artificialanalysis.ai/models/claude-opus-5-5-medium です。
「自転車に乗ったペリカンのSVGを生成して」をmaxで成功させるのに2回失敗しました。どちらの場合も、まだ問題について推論している最中に128,000トークンの予算を使い果たしてしまったからです。
「max」は、こんなに簡単に考えすぎて応答にたどり着かなくなるなら、事実上役に立たないのではないかと疑っています。
ある試行のトランスクリプトはこちらです - 「Reasoning trace」の部分を展開すると見られます: https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
- breckenedge
こうした評価はローンチから数週間後に再実行されるのでしょうか?昨日、社内データセットでそれを始めたところ、SolのパフォーマンスがLunaと同等まで後退していることに気づきました。もちろんこれは1回の実行にすぎませんが、ますます懸念していることがあります。モデルプロバイダーは自分たちが最高だと素早く証明したがり、人々がそれに乗り換えると、足元をすくわれるのです。
- hglaser
Opus 5と比べてタスクあたりのコストが半分、high effort同士の比較で。これは本当に嬉しいですね。
編集: https://artificialanalysis.ai/models/claude-opus-5-5?models=...
- mckirk
なぜこの「ペーシング」が「そうそうみんな、俺がリードしているうちにペースを守ろうぜ」という類のものになる気がするのだろう。
- linuxrebe1
これはうまくいってほしいと願っています。私はopus 5ではなくopus 4.8を使う方に戻っていました。単純に4.8の方が5よりも、自分が何をしているかを覚えていて指示に従うのがずっと得意だからです。5は問題を解く途中まで進んでから、道を見失い、問題に対処するのではなく脱線してしまうため、途中で止めなければならないことがよくありました。その点で、4.8はずっと安定していました。