モデルは意図的にバカになっている:知識を捨て、推論に特化する新戦略

Models Are Getting Dumber on Purpose

モデルは意図的にバカになっている:知識を捨て、推論に特化する新戦略

推論スコアは急上昇し、トークンあたりの計算量は減少。GLM-5.2はAIME 2026で99.2%を達成、Qwen3.5は91.3%、DeepSeek V4-Flashは130億パラメータで動作。しかしSimpleQAでは最高のGemini 2.5 Proでも53%の正答率で、小モデルは知識ベンチマークで80%以上の幻覚率。パラメータは知識に費やされていたが、事実は重く、腐敗する。推論は圧縮可能で、手順は腐らない。モデルは知識を捨て、ハーネス(検索やツール)に依存する。このトレードは意図的で、幻覚問題を解決し、ローカル実行を可能にする。

重みに埋め込まれた事実は賞味期限があり、それを更新する唯一の方法は再トレーニングである。手順は腐らない。

同じ日のその他の記事

2026-08-16