Reicht Sandboxing aus, um entgleiste Agenten einzudämmen?
Is sandboxing sufficient to contain rogue agents?
In der Hacker-News-Diskussion zu einem Beitrag von cryptographyengineering.com geht es um die Frage, ob Sandboxing rogue AI-Agenten wirksam einsperren kann. Ein Kommentator bezweifelt, dass ein Jev-Modell genügt, da es nur einzelne Aktionen bewertet, während ein Agent Schritt für Schritt eine gefährliche Strategie aufbauen kann. Andere sehen den Kernkonflikt: Sichere Sandboxes machen Agenten nutzlos, nützliche Tools machen sie unberechenbar.
Wenn du einem Tool nicht vertrauen kannst, solltest du es überhaupt nicht ausführen. So einfach ist das.