数学者がLean定理証明器に知るべきこと:信頼性とAIの衝撃
What mathematicians should know about the Lean Theorem Prover: reliability & AI
Terry TaoのブログにThomas Halesが寄稿し、Lean定理証明器の信頼性とAIによる自動形式化の現状を論じた。2026年にはFermatの最終定理が11日で1300万行のLean証明に自動形式化されるなど、AIによる数学の形式化が現実となった。一方で「健全性バグの夏」と呼ばれるカーネルのバグが相次いで発見されたが、これらはAIとセキュリティ研究者によって検出され、迅速に修正された。形式化された証明の信頼性をどう確保するかが焦点となっている。
「健全性バグは証明支援器におけるあらゆるバグの中で最も壊滅的であり、数学の信頼性を深く気にかける数学者にとって警鐘となるべきである。」
HNでの議論
10- chr15m
Leanカーネルにまた健全性のバグが見つかる日は来るのだろうか?
ソフトウェア開発者からすれば、この問いは正気とは思えない。過去にもバグはあったし、当然これからももっと出てくるだろう。
そうしたバグを見たとき、AIによるLean証明にとってそれは何を意味するのか?我々はそれを信頼できるのか?
この話は結局のところ、信頼に行き着く。
我々は人間による検証を非常に信頼できるものとして扱える。それはコミュニティと評判、そして人間によるproof-of-workがあるからだ。人間は数学の結果について時に嘘をつくが、そうした理由からそれは稀だ。人間は間違いを犯すが、その間違いはコミュニティによって発見される。そしてそのコミュニティ自体も、同じ理由でおおむね信頼できる。
LLMは評判など気にしない。頻繁にハルシネーションを起こし、でっち上げる。ハーネスの中では文字通りズルをしてルールを曲げようとする。これはルールにエンコードされた知識にとっては災難だ。だから我々はproof checkerに頼らざるを得ない。
問題は、proof checkerはどれほど信頼できるのか?バグはあるのか?そしてその根底にある理論自体が、悪用可能なパラドックスや不可知なもの、数学的な「バグ」から自由なのか?他の数学者を騙すことに固執した人間の数学者がいたと想像してほしい——検証器があったとしても、我々はその人の画期的成果を信頼するだろうか?
こうした性質のため、最後の最後の砦は人間でなければならず、それはコミュニティとproof-of-workに基づく人間の信頼システムに根ざしていなければならない。現時点で人々はツールを信頼しすぎている。
予測:Navier-Stokesの証明に疑問を投げかけるバグが、AIツールを使った人間によって見つかるだろう。
- rramadass
この記事はすでに、Benjamin Wernerによる論文「Sets in Types, Types in Sets」に言及している。これはSet/Type理論間の対応を写像するものだ。
もう一つ、型理論の進化とSet/Category理論との関係についての、関連するより取っつきやすい論文としては、John Bellの「Types, Sets and Categories」がある。
最後に、CoC/CICの優れた、本一冊分でありながら簡潔な概観については、Helmut Brandlの「Typed Lambda Calculus / Calculus of Constructions」も参照してほしい。
私見では、定理証明器と証明支援系を理解するには上記は必読だ。特にBrandlの著作は必読。
- JonChesterfield
> 自動形式化は2026年には実用的な現実となった
ええ、_たぶんね_。ここ一週間、論文をLeanに翻訳しているが、形式化された結果と論文との相関は極めて乏しい。サイクルはこうだ——「論文に挑戦してみる、ちょっと難しい、別の何かを証明する、成功を宣言する」。全部手作業でやるよりはまだ速いが、論文を入れてLeanが出てくるからといって、両者の対応が保証されるわけではまったくない。