수학자들, OpenAI에 "우리 연구 안 썼다는 증거 내놔라"
Mathematicians want proof OpenAI didn't use their work

OpenAI가 자랑스럽게 발표한 수학적 성과를 두고 수학자 Andreas Thom이 ChatGPT와 나눈 대화가 학습 데이터로 쓰였을 가능성을 제기했다. 그는 OpenAI의 해명이 직접 접근 여부만 다뤘을 뿐 학습 데이터 유입 여부는 답하지 않았다며 "기껏해야 부정직"이라고 비판했다. Tristan Buckmaster에 이어 두 번째로 제기된 이의 제기로, 연구자들은 OpenAI만이 관련 데이터를 갖고 있다고 지적한다.
"비식별화는 이름을 지울 수 있을지 몰라도 수학적 아이디어의 지적 내용은 지우지 못한다."
HN 토론
80- arutar
여기 (인접하지만 관련 있는) 맥락이 있습니다. 다른 곳에도 올라왔지만 여기서 다시 언급할 가치가 있다고 생각합니다:
https://mathstodon.xyz/@tao/117237320796901560
특히 최근 몇 년 동안 수학 커뮤니티는 매우 선의로 움직여 왔고, 아이디어에 적절한 공을 돌리기 위해 많은 노력을 기울입니다. 아이디어가 병렬적으로 발견된 경우에도 이전 작업에 동일한 핵심 아이디어가 포함되어 있었다면, 이 경우 우선권을 인정하는 것이 최선의 관행으로 널리 받아들여집니다. 좋은 학문적 관행의 요점은 전체 관행의 건강성을 유지하는 것입니다.
Terence Tao가 그 글에서 설명하듯이, 수학의 목표는 큰 문제를 해결하는 것만이 아닙니다. 그리고 설령 누군가가 큰 문제 해결에 매우 외골수적으로 집중하더라도, (장기적으로) 커뮤니티 전체의 건강성을 유지하는 것이 여전히 더 낫습니다. 그래야 현재는 손이 닿지 않는 문제들이 미래에 다시 손에 닿을 수 있기 때문입니다. 좋은 학문적 관행은 이 문화의 한 부분입니다.
- shmoil
Andrew Wiles는 3번의 강연을 했고, 마지막 강연이 끝날 때에야 FLT를 해결했다고 발표했습니다. 청중 중 누군가가 두 번째와 세 번째 강연 사이에 (당연히 그의 아이디어를 사용해서) FLT를 증명했다고 발표했다고 상상해 보세요.
OpenAI가 그러면 왜 괜찮은 건가요?
- asimpletune
고객이 곧 상품이 되는 문제로 다시 돌아간 것과 조금 비슷합니다.
제가 수학자라면 제 미출판 작업이 경쟁자의 손에 들어가는 것을 원하지 않을 것입니다.
제가 변호사라면 제 변론의 사적인 세부 사항이 검찰에 제공되는 것을 원하지 않을 것입니다. 익명이든 아니든.
저는 미출시 책의 줄거리가 다른 작가에게 제안되는 것을 원하지 않을 것입니다.
- throwaway713
제가 뭔가 명백한 것을 놓치고 있는 건가요? 이건 그냥 설정에서 “Data Controls” → “Improve model for everyone” 토글의 상태 이력을 확인하는 간단한 DB 쿼리 아닌가요? 그게 언제 켜져 있었는지, 어느 기간 동안이었는지만 보고하면 되는 거죠.
- aennassiri
만약 OpenAI가 모든 인류(미국이나 소수 주주만이 아니라)의 이익을 위해 "OPEN" AI를 만들려는 완전한 비영리 단체로 남아 있었다면, 저는 기꺼이 제 코드와 작업을 공유하고 심지어 그들의 데이터에 라벨을 붙이는 것도 했을 것입니다... 그렇긴 하지만, 저는 그들을 비난하지는 않습니다. 비영리로 남으면서 동시에 AGI를 구축하는 데 필요한 자본 투자를 확보하는 것은 어려운 사명입니다.
저는 그들을 비판하는 것이 아니라, 최고의 결과나 AGI를 향한 이 경쟁이 사용자 데이터를 동의 없이 사용하지 않는 것과 같은 좋은 결정을 내리는 데 눈을 멀게 하지 않기를 바랍니다.