MIT, 아동 학대 이미지 생성 모델을 이미지 생성 없이 100% 정확도로 적발하는 감사 방법 개발

MIT's New Method Flags AI Models Trained on CASM Without Generating It

MIT, 아동 학대 이미지 생성 모델을 이미지 생성 없이 100% 정확도로 적발하는 감사 방법 개발

MIT 연구진이 아동 성적 학대 자료(CSAM)를 생성하도록 미세 조정된 AI 모델을, 실제 이미지를 생성하지 않고도 100% 정확도로 식별하는 새로운 감사 방법을 개발했습니다. '가우시안 프로빙(Gaussian probing)'이라 불리는 이 기술은 모델의 출력 대신 내부 적응을 분석하여, 불법 콘텐츠 생성이 금지된 법적·윤리적 제약을 우회합니다. 연구진은 아동 보호 비영리 단체 Thorn과 협력했으며, 이 방법은 모델 호스팅 플랫폼에 통합되어 유해한 LoRA 어댑터의 확산을 차단할 수 있습니다. 이는 2025년에 150만 건 이상 신고된 AI 생성 CSAM 문제에 대응하기 위한 것입니다.

이것은 오픈소스 모델을 호스팅하는 플랫폼과 법 집행 기관이 모델이 CSAM을 생성할 수 있는지 실제로 테스트할 수 있는 새로운 경로를 열어줍니다. 이전에는 이를 측정할 방법이 전혀 없었습니다. 일부 사람들이 악용하고 있는 거대한 사각지대였습니다. 이제 우리는 심각한 부정적 영향을 미치는 AI 안전 문제를 해결할 수 있습니다.

이 날의 다른 글

2026-07-13