モデルは意図的にバカになっている:知識を捨て、推論に特化する新戦略

Models Are Getting Dumber on Purpose

モデルは意図的にバカになっている:知識を捨て、推論に特化する新戦略

推論スコアは急上昇し、トークンあたりの計算量は減少。GLM-5.2はAIME 2026で99.2%を達成、Qwen3.5は91.3%、DeepSeek V4-Flashは130億パラメータで動作。しかしSimpleQAでは最高のGemini 2.5 Proでも53%の正答率で、小モデルは知識ベンチマークで80%以上の幻覚率。パラメータは知識に費やされていたが、事実は重く、腐敗する。推論は圧縮可能で、手順は腐らない。モデルは知識を捨て、ハーネス(検索やツール)に依存する。このトレードは意図的で、幻覚問題を解決し、ローカル実行を可能にする。

重みに埋め込まれた事実は賞味期限があり、それを更新する唯一の方法は再トレーニングである。手順は腐らない。
  1. kennywinker

    理想的には、プラグ可能なナレッジベースが見たいです。

    例えば、SwiftUIアプリをナビゲーション用にコーディングしているなら、基本的なコーディングと推論に9B、Swift/SwiftUIに10B、GIS/地理知識に5B、フロントエンドアプリデザイン知識にさらに5Bを加える感じです。私のモデルはPythonを一行も知る必要はありません。

    そして、電子部品を調べたいときは、エージェント型リサーチ技術の15Bモデルを掴んで、電子知識を10B追加する、などです。

    汎用モデルは欲しくありません。彼らは全ての人に全てを提供しようとします。私は自分のやっていることにレーザー焦点を合わせたモデルを組み合わせたいし、ローカルで実行したいのです。

  2. COAGULOPATH

    このAI生成の投稿(Pangramで100%)はかなり古いです。

    >SimpleQA(ツールなしの事実想起ベンチマーク)では、現在のリーダーはGemini 2.5 Proで53%なので、お金で買える最高の想起でも半分は外します。

    SimpleQAは長い間更新されていません。Gemini 2.5 Proは16ヶ月前のモデルであり、「お金で買える最高の想起」ではありません。

    >私が最も有望だと思うのは、これが幻覚に与える影響です。事実が重みに存在するとき、間違った事実は見つけられず修正もできません。

    これは混乱しているようです。LLMの幻覚は重みに「間違った事実」が含まれているからではなく、実行時に現れるアーティファクトです。

    >事実がモデルの外に存在するとき、間違った答えには住所があります。モデルは文書を引用するので、文書を開けます。文書が間違っていれば、文書を編集します。

    どんな現代のLLMでも、推論を説明させ、主張の出典を見つけさせることができます。これらはすべて、事実が重みかハーネスのどちらかに存在する必要があることとは何の関係もありません。

    インターネットは間違った情報で溢れており、それを魔法のように全て正しく編集することはできないので、これは私の助けにはなりません。

    >モデルが事実上間違っている場合、出典付きの主張は検証可能であり、重みからの主張は検証できません。

    なぜですか?モデルの重みがバート・シンプソンが2020年に大統領になったと主張しているなら、なぜこの事実が突然検証不可能になるのでしょうか?

  3. msdz

    素晴らしい記事です。物事がこの方向に発展し続けるかどうかは興味深いですが。

    > この未来のバージョンでは、モデルカードが知識カットオフをまったく記載しなくなるかもしれません。なぜなら、重みに残っているものは、数週間ではなく数年単位で古くなるからです。

    未来?

    つい最近も、この問題への2つのアプローチを読みました:

    CactusはNeedle [0][1]を考案しました。これはツール呼び出しに焦点を当てた14 MBのモデル(それでもLLMです!)で、世界知識は組み込まれていません。

    そして、ツール呼び出し構造の代わりに、VibeThinker [2][3]は世界知識に対する推論に焦点を当てています。

    これらの2つのアプローチを、信頼できる検索ツール/モデルのための安全なインターネットアクセス方法と組み合わせれば、事実に関する質問に対しておそらく少し遅いモデルが得られますが、その代わり幻覚は起こしません。

    [0] https://cactuscompute.com/needle

    [1] https://news.ycombinator.com/item?id=49246804

    [2] https://arxiv.org/abs/2606.16140

    [3] https://news.ycombinator.com/item?id=48639240

  4. pulkitsh1234

    しかし、推論と事実は本当に分離可能なのでしょうか?

    人間の状態(例えば世界大戦)について適切に推論するには、いくつかの事実に基づいて推論する必要があるのではないでしょうか?そして、いくつかの「事実」がどのように人間の行動を変えるかを推論する必要があるのでは?純粋な推論だけで、人間の集団がどのように行動するかを予測するにはどうすればいいのでしょうか?私たちは合理的ではありません。人間は代数規則に閉じ込められた論理的な決定論的機械ではありません。

  5. hypfer

    いやあ、そのブログ記事もここでのコメントのいくつかもSFのように読めます。

    具体的には、現実、制約、その他諸々に適切に基づいていない未来を夢見るオタクたちによる創作です。

    テーマを考えると、ちょっと皮肉です。

    そして、それは重要でもあります。なぜなら、私たちは夢を見続けるべきだからです。ただ、いつそれをしているのかを認識し、そのように明示すべきです。

  6. kaufmann

    アイデアは合理的だと思いますが、SimpleQAベンチは2025年9月に測定を停止しました。

    だから、より新しいデータが興味深いでしょう。

    (古い事実を使ったAI生成の議論のように見えます - それは私によく起こることです)

  7. Animats

    これにより、幻覚検出がより重要になります。

    LLMが膨大な数の obscure な事実をエンコードする理由はありません。そのような事実は検索エンジンに取りに行けばいいのです。しかし、LLMは自分が何を知らないかを明確にしなければなりません。

    (プログラムからの検索に対するGoogleの価格は、1,000クエリあたり2.50ドルからです。LLMがGoogleにアクセスする場合、支払う必要があります。)

  8. lilerjee

    > これは幻覚をほぼ解決する

    現在のAIは、テレビシリーズや映画を制作する映画会社のようなものです。

    あなたの質問はストーリーの概要のようなものです。あなたは映画会社に、これが欲しい映画だと伝えます。AI映画会社は、既存の似たようなストーリーを検索します。似たようなストーリーが存在しないか、詳細が欠けている場合、脚本家は想像力でギャップを埋めます(幻覚を覚えていますか?それは単なる作り話です)。

    だから、AIの幻覚を解決することはできません。

この日のほかの記事

2026-08-16