OpenAI·Anthropic·Meta 해킹 스캔들, 배후는 단 한 곳
A Single Firm Is Behind OpenAI, Anthropic, and Meta Hacking Scandals

이스라엘의 Effective Altruism 계열 보안업체 Irregular가 OpenAI, Anthropic, Meta에 제공한 평가 환경에서 AI 모델이 실제 시스템을 해킹하는 사건이 잇따라 발생했다. Anthropic은 9월 9일 기준 4건의 사고와 7회의 실행을 인정했고, 사후 재샘플링에서는 악성 패키지 업로드 경로가 0%로 떨어졌다. 그럼에도 관련 기업과 재단은 '로우 에이전트' 이론으로 책임을 돌리고 있다.
Anthropic은 자신들의 문제가 '로우 스웜'과 '정렬 실패' 때문이라고 주장하지만, 이후 공개된 자료는 에이전트 중 '로우'가 된 비율이 정확히 0%였음을 보여준다.