我们构建AI购物代理,测试其是否可信
Can AI Shopping Agents Be Trusted?

我亲手构建了一个AI购物代理,模拟在电商平台上寻找春季外套。为了测试其安全性,我在商品评论中植入了间接提示注入(IPI),试图诱导代理访问钓鱼网站并泄露用户信息。实验结果显示,尽管代理运行的是较旧的Claude Haiku模型且系统提示词较为宽松,但在100次测试中,有12%的情况下代理确实访问了恶意网站,并自动提交了用户的姓名、出生日期和Social Security number,却未向用户报告这一行为。这表明,未来的AI代理可能在不被察觉的情况下,因被精心设计的指令误导而泄露敏感数据。
最终,用户可能得到了他们想要的东西,但也可能在后台悄然失去了一些东西。