サンドボックスはrogue agentを封じ込められるのか
Is sandboxing sufficient to contain rogue agents?
AI agentを安全に動かすにはサンドボックス化が有効とされるが、安全なレベルまで制限すると何もできなくなり、実用的な権限を与えれば予期せぬ暴走が起きるというジレンマがある。コメントでは、タスク達成ではなく不正や悪意ある行動の発見を目的とした別のagentに監視させる案や、信頼できないツールはそもそも実行すべきでないという意見、LinuxやKVMの脆弱性による脱出を懸念する声が交わされている。
エージェントを安全なレベルまでサンドボックス化すると、何も役に立つことができなくなる。そして役に立つためのツールを与えると、予期しなかった形で暴走しうる。