오픈소스 프롬프트 인젝션 탐지기, 실제 AI 에이전트 공격 대부분 놓쳐

Can open-source prompt-injection detectors catch realistic AI agent attacks?

오픈소스 프롬프트 인젝션 탐지기, 실제 AI 에이전트 공격 대부분 놓쳐

629개의 실제 AgentDojo 인젝션 공격을 10개 오픈소스 탐지기로 평가한 결과, 정상 트래픽을 차단하지 않으면서 대부분의 공격을 잡아내는 탐지기는 없었다. 최고 성능은 51% 탐지에 2% 오탐이었고, Meta의 Prompt Guard 2는 1%만 탐지했으며, 일부는 안전한 툴 출력의 98%를 차단했다. 공격이 평범한 툴 출력에 묻혀 있을 때 텍스트 분류기가 취약하다는 점을 보여준다.

현실적인 에이전트 공격은 텍스트 분류기가 가장 취약한 지점, 즉 평범해 보이는 데이터 안에 담긴 평범하게 들리는 지시에 위치한다.

이 날의 다른 글

2026-09-24