Anthropic 연구원, 베스팅 두 달 앞두고 사임하며 폭로하다
Good people refuse to do bad things
OpenAI와 Anthropic에서 3년간 사전학습 연구를 한 Jacob Coxon이 지분 베스팅을 두 달 앞두고 사임했다. 그는 두 회사 모두 책임감 있게 행동하지 않으며 자기 개선 초지능을 향해 질주하고 있다고 주장했다. Anthropic 정렬 팀 리드 Evan Hubinger도 AI가 인류를 멸종시킬 확률을 10% 이상으로 본다며 그를 지지했다. 2021년 Frances Haugen의 Facebook 내부 고발과 같은 패턴이다.
Jacob은 여기서 맞다—우리는 정말로 AI가 모든 인간을 죽일 수 있다고 진심으로 믿는다! 개인적으로 향후 10년 안에 그럴 확률이 10% 이상이라고 생각한다.