Lean, 수학을 구원할까? 신뢰성 위기와 AI의 역습
What mathematicians should know about the Lean Theorem Prover: reliability & AI
Lean은 30만 개의 정리를 가진 mathlib로 수학자들의 주목을 받아왔다. 2026년에는 AI가 자동으로 형식화하는 오토포멀라이제이션이 현실이 되어 페르마의 마지막 정리 등이 11일 만에 1,300만 줄의 Lean 코드로 증명되었다. 그러나 같은 해 여름, 커널의 사운드니스 버그가 잇따라 발견되며 수학의 신뢰성에 대한 근본적인 질문이 제기되었다. Thomas Hales는 이 글에서 Lean의 설계와 한계, 그리고 AI가 발견한 버그의 의미를 짚는다.
“여름의 Lean 사운드니스 버그”는 재앙처럼 들릴지 모르지만, 자세히 살펴보면 이러한 버그의 발견은 긍정적인 발전이다.
HN 토론
10- chr15m
Lean 커널에서 다시 soundness 버그를 보게 될까?
소프트웨어 개발자에게 이 질문은 미친 소리처럼 들린다. 과거에도 버그가 있었고, 앞으로도 분명 더 있을 것이다.
그런 버그를 보게 되면 AI Lean 증명에 어떤 의미가 있을까? 우리가 그것을 신뢰할 수 있을까?
이 모든 것은 결국 신뢰로 귀결된다.
우리는 인간의 검증을 높이 신뢰할 수 있는데, 그 이유는 커뮤니티와 평판, 그리고 인간의 proof-of-work 때문이다. 인간은 때때로 수학적 결과에 대해 거짓말을 하지만, 이런 이유로 그런 일은 드물다. 실수를 하면 그 실수는 대체로 신뢰할 만한 커뮤니티에 의해 발견된다.
LLM은 평판을 신경 쓰지 않는다. 자주 환각을 일으키고 조작한다. 하네스 안에서는 문자 그대로 속임수를 쓰고 규칙을 왜곡하려 하는데, 이는 규칙에 인코딩된 지식에 재앙이다. 그래서 우리는 증명 검사기에 의존할 수밖에 없다.
문제는 증명 검사기가 얼마나 신뢰할 만한가이다. 버그가 있는가? 그리고 기반 이론 자체가 역설과 불가해한 것들, 그리고 악용될 수 있는 수학적 "버그"로부터 자유로운가? 다른 수학자들을 속이려 작정한 인간 수학자를 상상해 보라. 검증기가 있더라도 우리가 그들의 돌파구를 신뢰할까?
이런 속성들 때문에 최후의 보루는 인간이어야 하며, 커뮤니티와 proof-of-work 기반의 인간 신뢰 시스템에 뿌리를 두어야 한다. 현재 사람들은 도구를 너무 많이 신뢰하고 있다.
예측: Navier-Stokes 증명에 의문을 제기하는 버그가 AI 도구를 사용하는 인간에 의해 발견될 것이다.
- rramadass
이 글은 이미 Set/Type 이론 간의 매핑을 다루는 Benjamin Werner의 논문 "Sets in Types, Types in Sets"를 언급하고 있다.
타입 이론의 진화와 집합/범주 이론과의 관계에 관한 또 다른 관련 논문이자 더 접근하기 쉬운 논문은 John Bell의 "Types, Sets and Categories"이다.
마지막으로 CoC/CIC에 대한 훌륭하고 간결한 책 분량의 개요를 원한다면 Helmut Brandl의 "Typed Lambda Calculus / Calculus of Constructions"도 참고하라.
내 생각에 위의 것들은 정리 증명기와 증명 보조기를 이해하기 위한 필독서다. 특히 Brandl의 저작은 반드시 읽어야 한다.
- JonChesterfield
> Autoformalization이 2026년에는 실용적인 현실이 되었다
어, _아마도_. 지난 한 주 동안 논문을 Lean으로 번역해 왔는데, 형식화된 결과와 논문 사이의 상관관계는 극도로 낮다. 주기는 "논문을 한번 시도해 보고, 좀 어려우면, 다른 걸 증명하고, 성공을 선언한다"인 것 같다. 여전히 전부 손으로 하는 것보다는 빠르지만, 논문 입력 -> Lean 출력이 둘 사이의 대응을 전혀 보장하지는 않는다.