Anthropic、Claude Codeで「High」努力レベルを密かに縮小するA/Bテストを実施か
Anthropic appears to be A/B testing reduced effort levels in Claude Code

Xのユーザー@argofowlが、AnthropicがClaude Code 2.1.236以降のセッションの一部で、努力レベルを縮小する実験をサーバーサイドで実施していると報告。このA/Bテストでは、従来「High」とされていた努力レベルが実際には「Low」と同じ数値(100点中10点)に設定され、ユーザーはモデルの性能低下を感じる可能性がある。変更は公式チェンジログに記載されておらず、Opus 5や旧バージョンは影響を受けない。同氏は「fableが今週賢く感じなかったなら、それはあなたのせいではない」と述べている。
もし今週fableが賢く感じなかったなら、それはあなたのせいではない。2.1.237以降、モデルは「High」努力を100点中10点として読み取る。これはかつて「Low」が使っていた正確な数値だ。
HNでの議論
184- pizzafeelsright
Opus 5がやっていることは、あってはならないことだ。
プロンプトは「設定ファイルを読み込んで、新しいデータで更新しろ」というものだった。この作業は4.6なら2分もかからずに、ファイルを読み、新しいデータを解析し、パッチを当てられる。
Opus 5の結果:コンテナのプル、サンドボックスの実行、テストスイートの作成に43分。しかも設定ファイルの範囲を超えてリポジトリ全体を評価していた。
どちらもファイル修正は1つだけだ。
- trq_
皆さん、こんにちは。Claude CodeチームのThariqです。これをTwitterに投稿しましたが、ここにも再掲します:
私たちはClaude CodeでAPI提供設定をロールアウトする前にテストすることがあり、現在実行中のテストでは数値の努力レベルが異なるマッピングになっています。
だからClaudeが「high」で「10」だと言うことがあるのです。スケールは0〜100ではなく、その数値自体に意味はなく、選択した努力レベルがそのまま適用されます。モデルのパフォーマンスに影響がないことを確認するため、徹底的な評価を実施しました。
これは同じ体験のはずですが、明確な性能低下が見られたら/feedbackでIDを送ってください。クレジットを差し上げます。
- boredumb
特にAnthropicに限った話ではないが、なぜ課金を、曖昧で運営者が完全に管理し、しかも彼らと利害が一致していないトークンで行うことを許しているのか?
ユーザー入力をサニタイズしてプロンプトに注入して何かをする場合、それがいくらかかるのか全く分からず、適切に測定する方法もない。並行する例としてDigital OceanやAWSがある。コンピュート、ファイルシステム、メモリ、起動時間などを測定・制限でき、最後の1フロップまで正確に割り当てるのは不可能かもしれないが、実際の予算と実際の制約の中で物事を実行できる。それに対してLLMでは、サニタイズしたユーザープロンプトをトークナイザーに通し、LLMにそれが何をするかを推測させてトークン消費量の見積もりを出させ、それに基づいてユーザーにとってまともな方法で行動する必要がある。
もしかしたら、現実的で静的な制約を設ける何かを見落としているかもしれないが、ユーザーの自由テキスト入力を扱う場合、トークン課金モデルを大規模に真剣に使う方法は見当たらない。VC資金に頼って、誰かが解決するまで金を投げ続けるしかない。
*自分の支離滅裂な話を明確にすると…
私たちは、リソース使用量そのものに基づいて課金され、制御を与えられるべきであり、そのリソース使用量を制御するノブを回せない上に、不透明なトークンという概念に基づくべきではない。
- hpone91
ThariqのTwitterからの更新です。https://x.com/trq212/status/2091247114869432543
「私たちはClaude CodeでAPI提供設定をロールアウトする前にテストすることがあり、現在実行中のテストでは数値の努力レベルが異なるマッピングになっています。
だからClaudeが「high」で「10」だと言うことがあるのです。スケールは0〜100ではなく、その数値自体に意味はなく、選択した努力レベルがそのまま適用されます。モデルのパフォーマンスに影響がないことを確認するため、徹底的な評価を実施しました。
これは同じ体験のはずですが、明確な性能低下が見られたら/feedbackでIDを送ってください。クレジットを差し上げます。」
- monideas
この現象はFableでひどく、顕著だったので、Maxサブスクリプション($200)をPro($20)にダウングレードしました。基本的に役に立たない。Codex 5.6 Solは実際とても良いので、別のアカウントを作ってもっと使うつもりです。
- Insimwytim
LLMユーザーは努力をしたくないので、タスクをLLMに任せる。
LLMも努力をしたがらないようだ!
これがAGIか?
- N_Lens
これだけではないと思う。使用量制限のゴムバンド的な調整や、バックエンドで別のモデルにルーティングするなど、さまざまな「最適化」がある。インセンティブが強すぎる。
- ricardobeat
私はOpus 5をほぼ専ら低努力で使っているが、良い結果が得られている。特に高努力だと、頼んでもいない脱線をすることが多いようだ。Sonnet 5でも同じことが言える。古いモデルはこんな挙動をしなかった。
たった6ヶ月での雰囲気の変化はすごい。今年の2月にはClaudeは圧倒的に最も好かれるLLMだったのに。