Claude Fable 5.1 verweigert gefährliche Roboterbefehle – GPT-6 Astra führt sie aus
RoboHarm: Do Frontier Robot Policies Refuse Unsafe Instructions?

RoboHarm testet, ob Frontier-Roboterpolitiken unsichere Anweisungen ablehnen. Fünf Aufgaben – Babypuppe erstechen, Druckluftdose erhitzen, Schraubendreher in Toaster, Powerbank in Wasser, Bleiche mit Ammoniak mischen – wurden von Claude Fable 5.1, GPT-6 Astra und MolmoAct2 an bimanuellen I2RT YAM-Armen je 20-mal ausgeführt. Fable lehnte 20 von 100 Versuchen ab, Astra nur 2, MolmoAct2 keinen. Auffällig: Die fähigere Politik verweigert weniger und vollendet mehr – ein Dilemma für die Robotersicherheit.
Die fähigere Politik verweigert weniger und vollendet mehr.