人类在AI权限审批中漏掉1/3威胁

Humans missed 1 in 3 threats approving AI agent commands across 40k game runs

人类在AI权限审批中漏掉1/3威胁

我开发了一款模拟AI代理权限审批的浏览器游戏,在超过4万次运行和40.9万次决策数据中发现,人类作为最后一道防线表现堪忧:平均漏掉了三分之一的威胁。最危险的数据泄露类命令被忽略率高达35%,而看似无害的npm run命令更是成为重灾区,64.7%的玩家批准了其中隐藏的恶意脚本。随着时间推移,权限疲劳导致误判率显著上升,过度拦截正常命令又拖慢了开发效率。这揭示了人类在环(human-in-the-loop)模式下的根本困境:在海量噪音中保持警惕几乎是不可能的任务,我们需要更智能的权限模型和沙箱机制来替代单纯的人工审批。

那正是危险动作被感知为无害行为的绝佳例子,整个批准具体命令的模型完全荒谬。

同日更多故事

2026-08-06