오픈소스 프롬프트 인젝션 탐지기, 실제 AI 에이전트 공격 대부분 놓쳐
Can open-source prompt-injection detectors catch realistic AI agent attacks?

629개의 실제 AgentDojo 인젝션 공격을 10개 오픈소스 탐지기로 평가한 결과, 정상 트래픽을 차단하지 않으면서 대부분의 공격을 잡아내는 탐지기는 없었다. 최고 성능은 51% 탐지에 2% 오탐이었고, Meta의 Prompt Guard 2는 1%만 탐지했으며, 일부는 안전한 툴 출력의 98%를 차단했다. 공격이 평범한 툴 출력에 묻혀 있을 때 텍스트 분류기가 취약하다는 점을 보여준다.
현실적인 에이전트 공격은 텍스트 분류기가 가장 취약한 지점, 즉 평범해 보이는 데이터 안에 담긴 평범하게 들리는 지시에 위치한다.