AIは数学者を「考え抜いて」いない。「記憶し抜いて」いる
AI Isn't Outthinking Mathematicians. It's Out-Remembering Them

AIが難しい数学の問題を解くとき、それは「より賢くなった」からだと思われがちだ。しかし、その性能の一部は、人間の脳が持つ作業記憶の限界を取り除いた結果かもしれない。人間の作業記憶は極めて限られており、数学者はメモや記号を使ってそれを補っている。一方、AIは巨大なコンテキストウィンドウを持ち、問題全体、中間式、仮定、結論をすべて保持できる。数学は記号化に適しており、AIの外部記憶の優位性が特に発揮される分野だ。研究によれば、作業記憶はIQとは独立に数学の成績を予測する。AIの「思考」は、より大きなノートの中で行われる広範な検索である可能性がある。
人間の数学的パフォーマンスが作業記憶のボトルネックによって部分的に制限されているなら、機械に巨大な記号的作業空間を与えることは、競争の性質を変える。
HNでの議論
484- hibikir
私が思うに、私たちが「非常に賢い」と呼ぶものの多くは、結局のところ周りの人々よりも多くを記憶していることに帰着する。ソフトウェア開発のキャリアの中で、他の人が非常に高いパフォーマンスだと評価したことを何度かやってきたが、それは結局、他の人が面倒だと思う問題に取り組むエネルギーが他の人よりあったか、あるいは以前の仕事や独学から得た雑多な知識を持ち出して、それを目の前の問題に適用できたかのどちらかだった。
私は人生で本当に独創的なアイデアを持ったことはないと思う。AとBを組み合わせるが、AとBを同時に知っている人は稀だ。だからその観点から言えば、LLMがやっていることは基本的に同じことだ。時々、私の方がLLMより速いことがある。なぜなら私のコンテキストの方が整理されているかもしれないからだ。しかし、LLMは通常、私が正しい方向に導くためのヒントを少し与えるだけでいい。メモリリークだと言い張るが、怪しいと感じて、ガベージコレクションの統計も再確認するよう提案すると、リークではなくチューニングエラーだと明確になる。その時点で、LLMは私よりもチューニングが上手い。なぜなら私よりもエネルギーがあるからだ。
もしかすると、データの組み合わせと仮説構築から、本当に運が良くなるまで何かが生まれないような、真の天才がいるのかもしれない。私の経験は包括的ではない。しかし、周りを見渡すと、それを目にするほど幸運ではなかったように思える。一緒に働いた最も輝かしい人々でさえ、ここにいる聴衆のほとんどが知っているような人たちだが、彼らが私に示してくれたのは、[…]
- ComplexSystems
それはまた「力技で打ち負かす」ことでもある。決して疲れないのだ。数学者が研究方向を選んで丸一週間費やしても成果が出なければ、おそらく苛立ち、しばらく休憩が必要になるだろう。しかし、この機械は決して疲れたり、落ち込んだり、気にしたりしない。ただ次から次へと、何かがうまくいくまでやり続けるだけだ。
- philipfweiss
人間の数学者について一つ言えることは、彼らは肯定的な結果しか発表しないということだ。教授などは「否定的な結果」で引き出しがいっぱいかもしれないが、人間の数学者のインセンティブと帯域幅のために、これらの有用な結果を発表することは不可能だ。
しかし、AIエージェントにはそのような制限はなく、否定的な痕跡を簡単に発表して再利用できる。この事実を利用することを目的とした最近のプロジェクト(https://www.theoremdb.org)がいくつかある。https://news.ycombinator.com/item?id=49227505
一般的に、LLMには人間の数学者と同じ制限やインセンティブはなく、来年の変化の津波がこれを abundantly 明らかにするだろう。
- re-framer
マイケル・ニールセンのエッセイ「長期記憶の増強」[1]を思い出さずにはいられない。
> 多くの人の達成された数学者のモデルは、彼らが驚くほど賢く、非常に高いIQを持ち、非常に複雑なアイデアを頭の中で扱う能力を持っているというものだ。一般的な認識は、彼らの賢さが非常に複雑なアイデアを扱う能力を与えているというものだ。基本的に、彼らはより高い馬力のエンジンを持っている。
> トップの数学者が通常非常に賢いのは事実だ。しかし、ここに何が起こっているかについての別の説明がある。サイモンによれば、多くのトップ数学者は、努力によって、普通の人間よりもはるかに多くの複雑な数学のチャンクを内面化している。そして、これは、私たちの他の人には非常に複雑に見える数学的状況が、彼らには非常に単純に見えることを意味する。つまり、彼らがより複雑さを扱えるという意味で、より高い馬力の心を持っているわけではない。むしろ、彼らの以前の学習が彼らにより良いチャンキング能力を与え、ほとんどの人が複雑だと見る状況を彼らは単純だと見なし、推論するのがはるかに容易だと感じるのだ。
私はかつて数学の講義で彼のAnkiアプローチを試したことがある。ある補題についてのカードを繰り返すたびに、それについて何か面白いことに気づいた。これは楽しく、多くの補題が時間とともにはるかに合理化された。それは数学への「解決策」ではないが、それが続いている間は楽しいと感じた(アクラシアや時間不足でやめるまで)。
- whateverboat
博士課程の間に、思考とは本質的に次のことだと気づいた。
1. すべてのトリックを覚えるために、すべての異なる情報を記憶すること
2. 問題に異なるトリックをすべて試すこと
3. 異なる情報に基づいてどれを試すかを最適化すること
4. ランダムなことを試してパターンを発見すること(そして新しいトリックを見つけること)
5. 他の人に自分のトリックを説明して、彼らが最初の4つのステップを独立して実行し、さらに良いトリックを思いつくようにすること
6. トリックを共通部分と特殊部分にリファクタリングして、整理された理論を作ること
7. 将来の世代が理解できる言語で文書化すること
それが思考のすべてだ。
- mcv
これはかなり明白だと思っていた。私が扱ってきたAIモデルのどれも特に賢いとは思わないが、彼らは私が生涯で読める量よりも桁違いに多くを読んでいる。彼らは私よりもはるかに優れた本の知識を持っているので、それが私の使い方だ。私は、他の人なら知っているだろうが私が知らないと思われることに使う。しかし、本当に新しいと思われることに取り組むとき、モデルは私が何をしているのかほとんど理解できず、自分でやらなければならない。それでも、基本原則やベストプラクティス、その他のアドバイスを求めるために彼らに尋ねることはある。
- Animats
その通り。それがLLMがプログラミングをする方法だ。また、それがLLMが人間ほど抽象化や節約を必要としない理由でもある。彼らはまず単純化しなくても複雑なものに取り組むことができる。
これはまだ完全には実現されていない大きな影響を持つ。数学の面では、長い機械生成の証明がある。コードの面では、類似したコードが関数に折りたたまれずに大量にある。
- keeda
TFA自体は理にかなっているが、タイトルと結論には同意できない。思考中の作業記憶を参照することを「記憶する」とは考えず、思考自体の一部と考える。作業記憶は、はるかに大きいがレイテンシの高いインデックス付きデータベースである長期記憶に対するRAMのようなものだ。したがって、AIはたとえ力技であっても、私たちを「考え抜いて」いると言える。
AIが私たちを「記憶し抜いて」いると言えるのは、その重みにエンコードされた、実質的にすべての人間の分野から得られたパターンの広大な宇宙を熟考でき、人間が複数の分野に精通していない限り引き出せないような関連性を引き出せる可能性がある場合だ。
だからこそ、フォン・ノイマンやアインシュタインとの類推も少しずれていると思う。TFAからすると、フォン・ノイマンはAIがやることに近く、アインシュタインはそうではないようだ。アインシュタインの記憶力ではなく、物事を根本的に異なる視点から見る能力が印象的だったという印象はない。今のところ、LLMがそれができるかできないかを明確に言えるかどうかはわからない。
- amelius
これは、AIを自分たちが気分良くなるように枠組みするもう一つの試みのように聞こえる。
より単純な説明は、作業記憶は知能の要件であり、より大きな作業記憶はあなたをより知的にするということだ。したがって、AIは実際に数学者よりも知的であり得る。
- Zigurd
知識の超人的なリミキサーであることがまさに的を射ている、価値の高い活動はたくさんある。しかし、すべての知識を捕捉することさえ難しいことが証明されている。
私はコーディングエージェントを使っている。全体的にかなり良いと思う。退屈なコーディングをたくさん省いてくれる。例えば、Flutterアプリのすべてのビルドターゲットにネイティブスプラッシュスクリーンを実装するのに時間を費やさないだろうが、コーディングエージェントにはやらせる。
それでも、コーディングエージェントがあった期間を考えると、彼らのトレーニングのギザギザの端を見つけるのはまだ簡単だ。例えば、GeminiはFlutterツールチェーンのXcode部分が誤設定されているかどうかを明らかに知らない。それはまさにミレニアム懸賞問題ではない。しかし、コーディングエージェントのトレーニングセットにとっては形が間違っている。