LLMはどんな数学が得意なのか?ティム・ガワーズが語る
Tim Gowers: What sort of maths are LLMs good at?
OpenAIが数学と理論計算機科学の10の主要問題を解決したことを受け、ティム・ガワーズはLLMがどのような数学的問題を得意とするのかを考察する。反例の発見に強いという説を検証し、ヴィノグラードフの定理とグルスキンの定理を例に、量化子の構造と問題の本質を分析。LLMの現在の能力と限界を探る。
LLMが反例を見つけるのが特に得意だという理論を提唱するなら、まず「反例を見つける」ことが何を意味するかを決める必要がある。
HNでの議論
164- h_mirin
これは、記事がその用語を使っていないにもかかわらず、本質的にはテスト時スケーリングに関する議論です。
最近では「テスト時スケーリング」は主にモデルがより長く自分自身と対話することを意味しますが、最初に真に驚くべき結果は単純なサンプリングから生まれました。GoogleのAlphaCodeは何百万もの候補プログラムを生成し、それを少数の提出物に絞り込み、2022年に平均的な人間のプログラマーを打ち負かしました。これはChatGPTが登場する前のことです。
サンプリングこそAIが得意とする分野です。例を作ることとLeetCodeを解くことは、検証が明確で安価である点で似ています。それに比べて「証明」は、Leanが機能する場合を除いて、依然として曖昧な概念です。ABC予想をめぐる騒動を見てください。だから人間がまだ必要です。
私にとって興味深い疑問は、「サンプリング」から十分に学習した後に何が起こるかです。AlphaGoの第37手はAIの鼻ではないでしょうか?それが数学で起こった場合、私たちは正しく、機械で検証可能でありながら、私たちが満足できる方法では説明できない結果を得ることになるかもしれません。
- scronkfinkle
> 良い兆候としては、LLMがはるかに広いクラスの問題で人間レベルに達したと言えるのは、人間の最高の数学の多くと同様に、新しく驚くべき方法で定理を証明し始めることですが、後から見れば美しく自然に見える方法であることです。また、偶然に stumble upon するのが難しい方法であるべきです。そのような証明が何に相当するかを正確に言うのは難しいですが、私たちはそれを見たときに認識できると思います。
同意します。OpenAIのこれらの結果を見た後、私たちは間違いなく以下の能力を持つ機械を手にしたと思います:
* 人類がこれまで学んできたほぼすべての主題に関する一般的な知識
* その知識を使って推論をシミュレートする能力(時にはあまりうまくいかないこともありますが)
* 知識の領域を横断して参照する能力
私にとって、これはほぼ「汎用人工知能」と呼ぶものに近いです。それはすべての一般的な人間の知能の累積的な知識を人工的な形に焼き込んだものであり、その知識を使って新しい目標を達成することができます。
数学のブレークスルーの多くの場合、既存のアイデアの組み合わせをたまたま知っていて、それを組み合わせて問題を解決するという洞察があります。ここで一般的な知識を持つことが特に強力であるように思えます。なぜなら、これらの機械を数週間連続で実行して、事実上総当たりを試みることができるからです。
とはいえ、現在の形のLLMがフーリエ変換のようなエレガントなものを発明するとは想像できません。
- steinwinde
数学におけるAIの成果のリストについては、https://mathoverflow.net/questions/502120/examples-for-the-u... または候補リスト https://aimath.robertj1.com/ を参照してください。多くの人がAIの反例や例の探索への親和性を指摘しています。前述のリストを見ると、もっと社会学的なことが頭に浮かびます。それは、著名で明確に述べられた問題に答えるための競争があるということです。私は数学者ではありませんが、数学の進歩は主にこれなのでしょうか?そもそも価値のある問題を提起することはどうでしょうか?理論構築はどうでしょうか?これらも同様に重要でありながら、AIを数学に活用している人は誰も興味を持っていないというのは正しいでしょうか?
- jerf
コーディングエージェントが並行コード、比較的単純な並行コードでも困難を示していることを考えると、それらが時相論理でどのように機能するかを見るのは興味深いでしょう。私はその分野の問題にAIを投げるほど知識がありませんが、それらがそこで大失敗するのではないかと思います。
(最近試す機会がなかったため、現在の最先端モデルを並行問題に投げる機会はありませんでした。最良の並行性は並行性がないことであり、次に良いのは「Webリクエスト」モデルで、多くのWebリクエストが名目上並行して実行されますが、それ以外は完全に分離されており、通信を試みません。だからもしかしたら改善されているかもしれませんが、もし大幅に改善されていれば、誰かが私が見るような場所で指摘しているだろうと思います。)
- n4r9
ガワーズ氏らしい、思慮深くバランスの取れた投稿です。最後の注記は簡潔で、ここに全文を掲載する価値があります:
> 良い兆候としては、LLMがはるかに広いクラスの問題で人間レベルに達したと言えるのは、人間の最高の数学の多くと同様に、新しく驚くべき方法で定理を証明し始めることですが、後から見れば美しく自然に見える方法であることです。また、偶然に stumble upon するのが難しい方法であるべきです。そのような証明が何に相当するかを正確に言うのは難しいですが、私たちはそれを見たときに認識できると思います。
- BeetleB
誰も言及していないので指摘しておきますが、ティモシー・ガワーズはフィールズ賞受賞者です。
- tel
ますます、私はLLMを本当に興味深いランダムオブジェクトの源として考えるようになりました。それはタスクに条件付けられた「合理的な思考」の大きな塊です。それらは一般的には正しいわけではありませんが、代わりに、その「ランダム性」がもっともらしい人間のパターンに従う可能性が非常に高い、集中したランダム検索の形です。
それを、その原材料を行動に変換する適切な機械と一緒にタスクに投げると、それはガタガタと動き回り、その終点で「もっともらしい人間の行動」をサンプリングします。
より賢い使い方もありますが、一般的なツールは、任意の確率的検索をこの新しい形式のランダムサンプリングを使用するようにアップグレードすることです。それははるかに効率的で、適切に条件付けられています。なぜなら、競合するランダムソースよりも、ありそうもないことを訪れる頻度がはるかに低いからです。
- dataviz1000
モデルが数学の問題をどのように解くかを覗いてみたいなら、私が基本的な掛け算を解くために作ったデータ可視化を見てください。[0]
私は能力(何ができるか)ではなく容量(どれだけうまくできるか)を示したかったのです。LLMが数学をどのように解くかを理解するには、最も単純な掛け算のケースを見てください。私は思考トークンの出力を分解して分類しました。モデルのトレーニングが、観察、方向付け、決定、行動(掛け算を行う)、そして再び観察するというループに構造的に従う思考トークン出力を生成することが非常に重要です。