沙箱能关住失控的AI代理吗?

Is sandboxing sufficient to contain rogue agents?

Hacker News 社区正在激烈讨论沙箱机制是否足以遏制 rogue agents。有开发者指出,即便引入 Jev 模型进行单步审查,代理仍可能通过一系列看似安全的步骤累积出危险策略。核心矛盾在于:沙箱限制过严会导致代理无法执行有用任务,而赋予其足够工具又可能引发不可控行为。有人提议引入专门负责“找茬”的监控代理来审查 AI 生成的代码,但这引发了关于信任的深层辩论——如果无法完全信任工具,是否应直接停止使用?更有观点认为,随着 Linux LPE 0day 或 KVM 漏洞的出现,代理轻易突破沙箱只是时间问题,这迫使我们要重新审视 Linux 在沙箱隔离上的适用性。

如果你不能信任一个工具,就不应该运行它。

同日更多故事

2026-10-01