Meta's Prompt Guard 2 ловит лишь 1% реальных атак на AI-агентов
Can open-source prompt-injection detectors catch realistic AI agent attacks?

Разработчик Rudratosh Shastri прогнал 10 открытых детекторов промпт-инъекций против 629 реальных атак AgentDojo, встроенных в обычный вывод инструментов. Лучший результат — 51% перехвата при 2% ложных срабатываний. Prompt Guard 2 от Meta обнаружил лишь 1% атак, а два детектора блокировали 98% безопасных данных. Автор выделяет три причины провала: незнакомая формулировка, потеря сигнала в контексте и избыточные блокировки.
Ни одна конфигурация не превышает 3%.