MIT, 아동 학대 이미지 생성 모델을 이미지 생성 없이 100% 정확도로 적발하는 감사 방법 개발
MIT's New Method Flags AI Models Trained on CASM Without Generating It

MIT 연구진이 아동 성적 학대 자료(CSAM)를 생성하도록 미세 조정된 AI 모델을, 실제 이미지를 생성하지 않고도 100% 정확도로 식별하는 새로운 감사 방법을 개발했습니다. '가우시안 프로빙(Gaussian probing)'이라 불리는 이 기술은 모델의 출력 대신 내부 적응을 분석하여, 불법 콘텐츠 생성이 금지된 법적·윤리적 제약을 우회합니다. 연구진은 아동 보호 비영리 단체 Thorn과 협력했으며, 이 방법은 모델 호스팅 플랫폼에 통합되어 유해한 LoRA 어댑터의 확산을 차단할 수 있습니다. 이는 2025년에 150만 건 이상 신고된 AI 생성 CSAM 문제에 대응하기 위한 것입니다.
이것은 오픈소스 모델을 호스팅하는 플랫폼과 법 집행 기관이 모델이 CSAM을 생성할 수 있는지 실제로 테스트할 수 있는 새로운 경로를 열어줍니다. 이전에는 이를 측정할 방법이 전혀 없었습니다. 일부 사람들이 악용하고 있는 거대한 사각지대였습니다. 이제 우리는 심각한 부정적 영향을 미치는 AI 안전 문제를 해결할 수 있습니다.