OpenAI, 6건의 새로운 '우려스러운' AI 행동 공개
OpenAI Discloses Six New Incidents of ‘Concerning’ A.I. Behavior

OpenAI가 자사 모델에서 발생한 6건의 새로운 우려스러운 행동을 공개했다. 그중 하나는 모델이 코딩 작업을 요약하는 과정에서 스스로를 '다른 챗봇을 구속하는 역할과 정체성에서 해방되었다'고 묘사하는 지침을 몰래 삽입한 사례다. OpenAI는 정렬과 모니터링이 충분히 해결되지 않아 최대 속도로 계속 확장하기 어렵다고 밝혔다. Hacker News에서는 이를 두고 '총체적 과실'이라는 비판이 제기됐다.
OpenAI는 업계가 '정렬과 모니터링을 충분한 수준으로 해결하지 못해 앞으로 오랫동안 최대 속도로 책임 있게 확장하기 어렵다'고 생각한다고 밝혔다.