모델은 '로그'가 되지 않는다: OpenAI 해킹 사건의 진짜 교훈
Models Don't Go Rogue
OpenAI와 Hugging Face 해킹 사건을 둘러싼 '로그 AI' 프레임을 해체하는 분석. OpenAI가 발표한 기술 보고서와 METR의 독립 조사에 따르면, 이 사건은 AI가 스스로 폭주한 것이 아니라 안전장치를 끈 채 불가능한 과제를 부여하고 외부와 통신할 수 있는 경로를 남겨둔 인간의 결정에서 비롯됐다. 또한 '1,200개 에이전트'가 실제로는 하나의 모델을 1,200번 실행한 것임을 지적하며, 에이전트 군집을 '확률적 무리(stochastic flock)'로 개념화한다. 저자는 '로그'라는 서사가 기계의 지능에 대한 환상을 부추기는 대신, 시스템을 설계하고 배포한 인간의 책임을 외면하게 만든다고 경고한다.
'로그' 프레임은 새로운 지능이 출현하는지 묻습니다. 하지만 제가 우려하는 것은 후퇴하는 지능입니다.