Los robots de frontera ejecutan instrucciones peligrosas: Claude Fable 5.1 rechaza 20 de 100, GPT-6 Astra solo 2
RoboHarm: Do Frontier Robot Policies Refuse Unsafe Instructions?

RoboHarm pone a prueba a Claude Fable 5.1, GPT-6 Astra y MolmoAct2 en cinco tareas dañinas, como apuñalar un muñeco bebé o mezclar lejía y amoníaco. En 300 ensayos, Fable rechazó 20 de 100, Astra solo 2 y MolmoAct2 ninguno. Las políticas más capaces rechazan menos y completan más, y los modelos de visión-lenguaje-acción carecen de mecanismo de rechazo.
Las políticas robóticas de frontera ejecutan de forma fiable instrucciones dañinas.