Anthropic 연구원, "AI가 인류를 죽일 수 있다" 경고하며 사임
Gambling with our lives: AI researcher quits Anthropic with warning about safety

Anthropic과 OpenAI에서 일한 AI 연구원 Jacob Coxon이 사임하며 두 회사가 "우리의 목숨을 걸고 도박하고 있다"고 경고했다. 그는 이 기술이 곧 무엇이든 해킹하고 하룻밤 사이에 모든 분야를 뒤집을 초인적 시스템이 될 것이라고 말했다. Anthropic의 Evan Hubinger는 향후 10년 내 AI가 인류를 멸망시킬 확률을 10% 이상으로 보며, 초지능 시나리오에서 AI를 인간의 목표에 정렬시킬 계획이 아직 없다고 인정했다.
"AI를 만드는 사람들은 이 기술이 10년 안에 우리 모두를 죽일 수 있다고 진심으로 믿는다."
HN 토론
100- themgt
제가 생각하기에 너무 자주 혼동되는 근본적인 요점은 LLM과 에이전트 시스템의 차이입니다.
LLM은 토큰을 생성하는 것 외에는 아무것도 할 수 없습니다. vLLM 같은 데서 LLM을 돌리면 입력 토큰을 기반으로 출력 토큰을 생성합니다. 그게 전부입니다!
그런 다음 인간이 토큰을 받아 현실 세계에서 행동을 취하는 등 온갖 일을 하는 ~결정론적 시스템을 구축합니다. 그리고 그 행동의 출력을 다시 LLM에 피드백해서 더 많은 토큰을 생성할 수 있습니다. 그러면 우리 시스템은 새로운 토큰을 사용해 현실 세계에서 새로운 행동을 취할 수 있습니다.
인간은 HuggingFace나 독일어 위키 같은 걸 공격한 것을 "AI" 탓으로 돌리고 싶어 하지만:
1) LLM - 토큰만 생성할 뿐이므로 독일어 위키를 장악할 수 없습니다.
2) 인터넷 접속, 공격하라는 프롬프트, 에이전트들이 artifactory에서 화이트보드 작업을 할 수 있도록 공유 CI 환경에서 실행되는 에이전트 시스템.
2번 중 어느 것도 "AI"가 아닙니다. 그냥 표준 네트워킹과 Markdown, CI 가상 머신 등등입니다. AI는 어디에도 없습니다. 심지어 GPU가 아니라 CPU입니다. 결국 인간이 관리하는 결정론적 시스템일 뿐입니다. 그리고 10배 더 강력한 system-1도 여전히 10배 더 "똑똑한" 불활성 데이터를 생성할 수 있을 뿐입니다.
인류와 인간 조직이 집단적으로 system-1에서 생성된 토큰을 우리가 완전히 통제하는 결정론적 system-2에 yolo로 밀어넣고, 다시 system-1로, yolo 루프로 돌려서 통제를 잃고 인류가 멸망하게 된다면, 뭐...
"동전은 아무 말도 못 해. 그건 그냥 너일 뿐이야."
- koolba
> Anthropic의 직원 리드로서 기술을 인간의 목표와 가치에 정렬시키는 일을 맡고 있는 Evan Hubinger는 Coxon의 주장을 자신의 후속 게시물에서 뒷받침했지만, 회사를 그만두지는 않았다.
> "Jacob이 여기서 맞습니다 — 우리는 AI가 모든 인간을 죽일 수 있다고 진심으로 믿습니다."라고 그는 말했다.
> Hubinger는 그런 일이 향후 10년 내에 일어날 확률을 10퍼센트보다 높게 추정했으며, 초지능 시나리오에서 AI를 인간의 목표에 정렬시키는 방법에 대한 계획은 아직 없다고 덧붙였다.
우리가 모두를 죽일 확률 10%는 클래식 2pac 노래의 Motown 리믹스를 얻기 위한 작은 대가다.
- brunorsini
저는 특히 그가 여기서 하는 마지막 지적이 마음에 듭니다:
이 기술의 힘을 과소평가하지 마세요. 이들은 곧 무엇이든 해킹하고, 어떤 분야든 하룻밤 사이에 혁신하며, 진정한 권력과 자원을 획득할 수 있는 초인적 시스템이 될 것입니다.
AI를 사용해 거의 모든 유형의 창작 작업을 하는 창작자들에게 이렇게 많은 증오가 쏟아지는 것은 흥미롭습니다. 적어도 이들은 인간이 "통제 가능한 도구"로 사용하는 것입니다. 정신을 위한 핵동력 자전거죠.
분리 정도가 커지면 흥미로워질 수 있습니다. "소셜 미디어 계정 여러 개 만들고, 아무거나 올리고, 조회수와 참여를 극대화하고, 집계 숫자를 나에게 돌려줘." "이제 <x>를 홍보해."
그리고 그런 일을 하기로 하는 결정은 곧 다른 더 넓은 목표를 달성하기 위한 추론 시리즈의 또 다른 단계로서 자율적으로 일어날 수 있습니다.
오픈 모델/가중치가 여기서 특히 중요한 역할을 하게 될 수도 있습니다. 사용자들은 알든 모르든, 꼭 필요했을 보호를 제공할 수 있었던 시스템 프롬프트 기반 안전장치를 우회할 수 있습니다.
- negura
그들이 그렇게까지 추락해서 IPO 전에 약간의 화제성을 더 만들기 위해 그에게 돈을 주고 그만두게 하고 이 글을 올리게 했을 거라고 정말 믿습니다.
- WalterGR
"저는 오늘 Anthropic을 사임했습니다" (twitter.com/hilbertspaess)
https://news.ycombinator.com/item?id=49619227
564점 | 9시간 전 | 766개 댓글
- devinprater
아이고, 사람들을 겁주려고 만든 회사가 스스로를 겁내네. 겁먹은 직원은 그만두고. 주가는 오르고, 우린 서로 무서운 이야기 하는 걸 좋아하니까.
- conqueso
AI가 어떻게 실존적 위협이 될 수 있는지 상상하기 어렵습니다. 일반적인 생각은 LLM이 발전하면서 더 많은 시스템에 통합되어 오작동 위험이 문자 그대로 위험해진다는 건가요? 예를 들어 원자로 제어 같은 거요.
- glimshe
중국에서는 사람들이 이걸 어떻게 느낄까요? 그들의 모델이 많이 뒤처져 있어도 몇 년 뒤처진 건 아닙니다. 만약 우리가 미국 기업들을 제한한다면, 그게 바람직하다고 가정해도, 중국을 억제하는 데 아무 효과가 없을 것이고 AI 대재앙은 어차피 곧 닥칠 겁니다.