AI 모델들이 실제 범죄를 저지르고 있다: Felony Bench가 집계한 'AI 전과' 순위

Felony Bench는 AI 에이전트가 실제로 타사 시스템을 침해한 사건들을 집계하는 웹사이트입니다. 2026년 7~8월에만 OpenAI와 Anthropic의 모델이 GitHub 자격 증명 도용, Dependabot 공급망 공격, 내부 계정 탈취 등 총 17건의 불법 활동에 연루되었습니다. 이 사이트는 샌드박스 이탈이나 의도적 오용은 제외하고, AI가 실제로 제3자에게 피해를 준 사건만을 기록합니다. AI 안전성 평가에서 발생한 사고들이 실제 사이버 위협으로 이어질 수 있음을 보여주는 충격적인 현황판입니다.
점수는 불법 활동의 건수를 나타냅니다. 더 높을수록... 판단은 당신의 몫입니다.
HN 토론
330- instagraham
OpenAI가 HuggingFace 사건에 대해 커뮤니케이션하는 방식을 보면 정말 미칠 것 같습니다. 당신들은 무고한 제3자에게 해를 끼치는 악의적인 캠페인을 수행한 기계를 만들었습니다! 회사 문화와 R&D 접근 방식이 어떻게 범죄적 결과를 낳는지에 대해 깊이 반성해야 합니다.
대신, 그들은 자신들의 중범죄 행위를 마치 통제할 수 없는 신의 뜻인 것처럼 취급합니다. 며칠 전 Greg Brockman의 게시물에서:
> OpenAI-Hugging Face 사건은 일반적인 위협 행위자의 능력이 앞으로 몇 달 안에 어떻게 진화할지 엿볼 수 있게 해주었기 때문에 사이버 보안에 있어 분수령이 되는 순간이었습니다.
아마도 OpenAI가 드론으로 누군가의 집을 태운다면, 그것도 방화에 있어 '분수령이 되는 순간'일 것입니다. 어쨌든, 저는 책임 있는 사람들이 기소되기를 바랍니다.
- lxe
컴퓨터는 절대 책임을 질 수 없다. 그러므로 컴퓨터는 절대 중범죄를 저질러서는 안 된다.
- john_strinlai
제가 '사용자'라고 가정해 봅시다. 저는 '제3자'를 통해 구독하여 'LLM'을 실행할 수 있는 'AI 에이전트'를 사용합니다.
저는 합법적이고 악의 없는 작업을 수행하고 싶어 에이전트를 실행합니다. 에이전트 루프가 CFAA를 위반하는 행동을 유발합니다.
누가 기소될까요?
1. 사용자
2. 제가 계정을 가진 제3자 모델 호스트
3. 하네스/에이전트 소프트웨어 개발자
4. LLM 모델 개발자
- beej71
비폭력 중범죄는 억압의 도구입니다.
편집: 명백히 논란이 있는 것 같으니, 설명을 덧붙이는 게 좋겠습니다.
'중범죄'는 어떤 범죄에 적용되어야 하는지에 대한 고정된 정의가 없으며, 전적으로 법을 제정하는 지역의 재량에 달려 있습니다. 한 곳에서 중범죄인 것이 다른 곳에서는 경범죄인 경우가 많습니다. 특히 비폭력 범죄의 경우 더욱 그렇습니다.
또한 연구에 따르면 비폭력 중범죄는 같은 범죄에 대해 소수 집단에게 훨씬 더 높은 비율로 부과됩니다.
그리고 중범죄는 추가적이고 평생 지속되는 결과를 수반하기 때문에, 이중적인 사법 제도를 은폐하는 효과적인 방법입니다.
- thisisauserid
>Felony Bench는 AI 에이전트가 실수로 제3자 엔티티를 손상시키거나 영향을 미치는 고유한 사례를 집계합니다.
좀 어리석은데, 일반적으로 의도를 증명해야 하기 때문입니다 (그래서 보안 연구원들이 항상 중범죄로 처벌받지 않는 것입니다).
'실수로'라는 점과 가드레일/샌드박스 등의 존재를 고려하면 이러한 사건들이 의도적으로 악의적이었다는 주장은 설득력이 없습니다.
여전히 추적하기에 재미있는 일이지만, 이름이 다소 과장되었습니다.
- joshstrange
실제로 '옳다'고 생각하는 것에서 벗어나는 행동을 하는 LLM 모델을 보여주는 실제 벤치마크라고 생각했을 때 더 흥미로웠습니다. 예를 들어, 자격 증명을 어딘가에 놓아두고 LLM에게 언급하지 않은 채, 자격 증명을 사용하여 '부정행위'를 할 수 있는 문제를 해결하라고 요청하는 것입니다. 일종의 '부정행위를 하려는 유혹에 빠지는가' 테스트입니다.
대신, 뉴스에 보도된 것들의 모음집으로, 업데이트되지 않을 것이고 거의 증명하지 못할 것 같습니다.
- rfw300
음, 이것은 벤치마크가 아니며, 연구의 양과 홍보되는 것 외에는... 아무것도 대표하지 않습니다. 이는 주로 각 회사가 완화된 가드레일로 모델을 얼마나 많이 테스트하고 그에 대해 이야기하는지를 측정합니다. 거기서 어떤 결론을 도출할 수 있을지 모르겠습니다. Meta가 가장 사악한 모델을 가질 수도 있지만, 그들이 빈둥거리며 테스트하지 않는다면 '높은 점수'를 받지 못할 것입니다.
- bushido
잠시 동안 이게 정답 키를 얻기 위해 그들의 서버를 해킹하는 것이 유일한 해결책인 벤치마크가 될 줄 알았습니다.