OpenAI, 미해결 Millennium Prize 문제를 풀어내다 — 하지만 표절 논란에 휩싸이다
The Navier–Stokes Millennium Prize Problem
OpenAI가 공개되지 않은 모델로 Navier–Stokes 존재성과 매끄러움 문제를 해결했다고 발표했다. 하지만 NYU 수학과 교수 Tristan Buckmaster는 Anthropic 직원 Levent Alpöge와 함께 약 1년간 이 문제를 연구해 8월 15일 돌파구를 마련했다며, OpenAI가 자신들의 Codex 세션 데이터를 학습에 이용했을 가능성을 제기했다. OpenAI는 사용자 데이터를 열람하지 않았고, 비식별화된 데이터가 모델 개선에 기여했을 수는 있다고 인정했다.
만약 내가 ChatGPT를 사용해 Millennium Prize 문제를 부분적으로 해결한다면, 내 작업이 학습에 영향을 미쳐 나중에 다른 누군가가 먼저 이 문제를 해결하도록 도울 가능성은 얼마나 될까?
HN 토론
233- bob1029
> ... 두 개의 Millennium Prize 문제가 해결되었다는 소문을 들었습니다. 이 소문에서 영감을 받아 ...
저는 지난주에 바로 이 효과를 목격했습니다. 코드베이스에서 단계적인 성능 개선에 관한 발견을 했습니다. 벤치마크 결과를 동료와 공유했더니 12시간 안에 동일한 결과를 재현했습니다. 우리 둘 다 이걸 수년 동안 찾고 있었습니다.
요즘은 답이 존재한다는 희망을 주는 것이 곧 답을 주는 것과 같을 수도 있다고 생각합니다. 경쟁은 무시무시한 약이고, 최전선 LLM들은 그 에너지를 공격적으로 증폭시킵니다.
- burrish
> 가능성은 낮지만, 우리 제품 사용에서 파생된 비식별화 데이터가 우리 모델 개선에 도움이 되었을 가능성을 배제할 수 없습니다.
OpenAI 직원으로서, 그의 작업이 훈련 데이터에 들어갔는지 알 수 없다는 게 무슨 말인가요?
그런데 제가 틀렸다면 정정해 주세요. 만약 두 수학자가 이 문제를 끝내기 직전이었고 그들의 대화가 OpenAI에 의해 사용되었다면,
에이전트가 "490만 개의 메시지와 약 3000억 개의 출력 토큰을 사용"하는 대신 훨씬 더 빠르고 효율적으로 성공했어야 하지 않나요?
- pietz
저는 OpenAI의 주장이 어쩐지 더 공감 가고 합리적이라고 생각합니다.
- 다른 팀/회사가 해결했다는 소문이 있는 문제에 컴퓨팅을 쏟아부어 자신들의 비밀 모델이 무엇을 할 수 있는지 확인했습니다.
- 제가 읽은 글들은 OpenAI가 대화하고 공을 아낌없이 나누고 싶어 했던 것처럼 보입니다.
- Anthropic의 누군가와 최전선 수학 문제를 함께 연구하는데, Codex를 사용할 뿐만 아니라 데이터 훈련을 허용하는 비업무 계정을 통해서도 사용한다고 상상해 보세요.
- 타임라인상, 그들이 주로 GPT 5.6을 사용했다면 현재 내부적으로 검증 중인 모델에 의미 있는 데이터가 들어갔을 가능성은 낮습니다.
- civvv
LLM은 훈련 데이터에 기존 작업/시도가 엄청나게 많은 수학 문제를 푸는 데 매우 뛰어난 것 같습니다. 이는 놀라운 능력이지만, 이 모델들이 인간처럼 «생각»하거나 «추론»한다고 저를 설득하지는 못합니다. 인간 수학자는 이론적으로 순전히 자신의 «인간 지능»에 기반해 내일 완전히 새로운 수학 분야를 분류/발견할 수 있습니다. LLM도 곧 비슷한 사례를 보여줄지 궁금합니다. 현재로서는 LLM이 인간 수학자를 대체할 수 있다고 생각하기 불가능해 보입니다. 왜냐하면 (추정컨대) 엄청난 양의 기존 시도/데이터라는 의미에서 인간 입력에 의존할 가능성이 크기 때문입니다.
만약 내일 새로운 수학 분야 내에서 완전히 새로운 문제가 나타난다면, LLM이 스스로 유용할 것이라고는 매우 의심스럽습니다. 이것이 «궁극의 ASI 테스트»인가요?
- tosh
> 이와 관련해 제가 가장 좋아했던 두 가지 가상 질문은 다음과 같았습니다:
> 제가 Codex를 실행 중인데 제 API 키 중 하나가 실수로 컨텍스트에서 소비된다면, 나중에 다른 사람이 API 키를 요청해서 제 것을 돌려받을 확률은 얼마나 될까요? (한번 OpenAI 관계자에게 물어봤더니 이를 "역류(regurgitation)" 문제라고 부르며 이를 방지하기 위해 엄청난 노력을 기울인다고 장담했지만... 어떻게 하는지는 설명하지 않았습니다.)
> 제 회사의 잠재적 새 방향에 대해 ChatGPT와 브레인스토밍한다면, 6개월 후 경쟁자가 "회사 X가 다음에 무엇을 계획할까?"라고 물었을 때 그 정보가 노출될 확률은 얼마나 될까요?
> 이에 대한 제 새로운 선호 가상 질문은 이것입니다:
> 제가 Millennium Prize 문제를 부분적으로 해결하는 데 ChatGPT를 사용한다면, 제 작업이 훈련에 영향을 주어 나중에 다른 누군가가 먼저 해결하도록 도울 확률은 얼마나 될까요?
- geraneum
Apple이 OpenAI를 상대로 제기한 혐의를 생각해 보면, 거기서 어떤 형태의 위법 행위가 있었을 가능성이 전혀 상상할 수 없는 일은 아닙니다.
- shellfishgene
이 이야기에서 빠진 부분은 아마도 "...그러다 8월 15일에 돌파구를 찾았다. 수학 소문 시장이 들썩이기 시작했다..." 부분일 것입니다. 만약 그들 둘만 비밀리에 문제를 연구하고 있었다면, 그들의 돌파구는 어떻게 소문이 되었을까요?
- michalsustr
Navier–Stokes 폭발 구성이 시각적으로 어떻게 보이는지 탐구하고 싶다면, 재미로 발표된 결과를 바탕으로 인터랙티브 3D 시각화를 바이브 코딩했습니다 :)