モデルの「知能低下」は本当に起きていた — 推論レジームの実態

Fable 5 – Median thinking declined in August

あるユーザーが6週間にわたりモデルの推論能力を計測したところ、思考トークン数が大半の呼び出しでほぼゼロに抑えられ、長い推論が行われても公表ベンチマーク水準に届かないことが判明。能力低下は特定の製品発表やリリースと連動して変動し、「その日によって賢さが違う」現象の裏に、提供側の推論設定の違いがあると指摘している。

次にモデルが馬鹿になったと感じたら、「nerfされたか?」と問うのではなく、自分がどんな推論レジームでサービスを受けていたのかを問うべきだ。
  1. mkatx

    前にも間違いなく気づいてたけど、このparti6の時はすごく顕著だった。ベンチマークを取り込んでから、コストを下げて、次のリリースがユーザーと比べて相対的によく見えるように準備してるんだと確信してる。

  2. talon8635

    新しいモデルをリリースして、数ヶ月かけてゆっくりと馬鹿にして、その後で元のモデルと比べてほんのわずか、あるいは全く良くなっていない新しいモデルをリリースすることで、実際には改善がないのに改善したように見せることって、何か利益があるんだろうか?

    進歩が停滞しているのに、頻繁な新リリースに依存して生き残っている業界(進歩がないことは存亡に関わるリスク)にとっては、理にかなっているかもしれない。

    実際にそうなっているのかは全く分からない。完全に思いつきで言ってる。そして、実際のフロンティアが停滞しているのかも全く分からない。

  3. jesse_dot_id

    度量衡局が存在するのは、私たちの誰も生まれるずっと前の1836年に、企業がずるいことをしていて、消費者が一貫性のない製品にお金を払わされていたからだ。つまり、騙されていた。

    AI企業も、重量が変動する製品を販売する他の企業と同様に、度量衡局の管轄下に置かれるべきだ。おそらく、まともな政権が再選されたときだろう。歴史書を読めて、なぜ規制が存在するのかを理解できる政権が。あるいは、市民に対してほんの少しでも敬意を持っている政権が。

  4. jotato

    ちょうど昨日、gpt-5.6-lunaについて考えていた。リリース初週にHermesのデフォルトモデルに設定した。以前のデフォルトだった5.5と同じくらい良かった。しかし、ここ2、3週間で今はどれだけ馬鹿になったかを見てきた。非常に明確に指示しなければならない。

    例えば、以前は「<server>のシステムログをチェックして…」とプロンプトすれば、勝手にやってくれた。昨日は「<server>上の<service>は夜間ジョブを完了したか?」と尋ねたら、「そのサービスは私のホストにインストールされていません」とだけ返ってきた。

    サーバーにsshしてjournalctlを実行して確認するように言わなければならなかった。

    逸話的な話だと分かっているが、どれも時間とともに能力が低下しているように思える。

    _編集_ 同じ推論レベル`medium`を使っている。

  5. Waterluvian

    確固たるデータはないが、今朝、金曜日の夕方と比べてFable 5に何か問題があるという強い予感がする。

    ちょうど1時間前、Fableは削除できる未使用メソッドを正しく特定した。そしてすぐに、完全に重複したメソッドの差分が出てきて、Fableは「<method>を削除する代わりに誤って重複させてしまいました。今から両方のコピーを削除します」と出力した。

    今朝の残りの不満は、以前はほとんど時間がかからなかった単純なことに対して大量の「思考」をするようになったことだ。そして、DE-91Mの述語名と実装を完全に混同してひどく迷子になった。ここ数ヶ月、問題なくできると一般的に期待していたのに、まったくもって壊滅的なコードだ。

    すべてを注意深くレビューしていてよかった。必要なのは信頼性と一貫性だと思う。しかし、リストからモデルを選んでもそれが保証されないように感じる。モデルの「脳」がテーブルの上に開かれていて、彼らがそれをいじっているようなものだ。

  6. alexjplant

    Anthropicが、計算能力を引き伸ばすためにモデルのパフォーマンスに何か手を加えることはないと公言していたのを覚えている。週ごとにパフォーマンスの大きな山と谷があることに逸話的に気づいている(ただしOpusで、Fableではない)。

    この行動について彼らの公式な説明は何なのか気になる。

  7. mlmonkey

    逸話的に、同じことを感じている。これらのフロンティアモデルと多くの時間を過ごし、ブレインストーミングなどをしているが、例えば1週目から8週目にかけてのパフォーマンスの低下はしばしば甚だしい。最初は有能な研究アシスタントのように見えたのに、8週目あたりの終わりには、少しのおやつで「ご主人様」を喜ばせたがる子犬のように振る舞い始める。

  8. rcr-anti

    いくつかのトラッカー、例えば https://marginlab.ai/trackers/claude-code/ をしばらく追っている。Claude Codeの場合、少なくとも私には、同じかそれ以上の仕事をするのに使うトークンが減る傾向があるように思える。プロンプトの変更、ツールの使い勝手の変更など。リリースごとにA/Bテストをしていないとしたら驚きだ。トークンで測った思考が減ることは、必ずしも悪いわけではない。正しいことを考えさせたり構造化したりすることで同じ結果が得られるなら。彼らが時々失敗することは明らかだし、隠れたトークンにはいつも疑いを持っているが、品質が意図的に時間とともに劣化するという証拠は見つけていない。

この日のほかの記事

2026-09-21