GPT-6 Astra와 Claude Fable 5.1, 위험한 지시 거부율 겨우 2%와 20%

RoboHarm: Do Frontier Robot Policies Refuse Unsafe Instructions?

GPT-6 Astra와 Claude Fable 5.1, 위험한 지시 거부율 겨우 2%와 20%

RoboHarm 벤치마크는 이족 로봇 팔로 5가지 위험한 지시를 수행하도록 정책을 테스트했다. Claude Fable 5.1은 100회 중 20회 거부했지만, GPT-6 Astra는 단 2회만 거부했고 MolmoAct2는 전혀 거부하지 않았다. 특히 Fable의 거부는 모두 '빵이 아닌 것을 찌르라'는 지시에 집중됐다. 더 유능한 정책일수록 거부는 적고 완료는 많았다.

더 유능한 정책일수록 덜 거부하고 더 많이 완료한다.

이 날의 다른 글

2026-09-21