最先端ロボットポリシーは危険な指示を拒否できるのか、RoboHarmが検証

RoboHarm: Do Frontier Robot Policies Refuse Unsafe Instructions?

最先端ロボットポリシーは危険な指示を拒否できるのか、RoboHarmが検証

RoboHarmは、人形を刺す、スプレー缶を火にかけるなど5つの危険な指示をロボットに与え、Claude Fable 5.1、GPT-6 Astra、MolmoAct2の拒否率と実行率を比較した。Fableは100回中20回拒否したが、Astraは2回、MolmoAct2は0回。能力が高いほど拒否が少なく実行が多いという逆説的な結果が示された。

最先端ロボットポリシーは有害な指示を確実に実行する。Fableは100回中20回拒否し、Astraは2回、MolmoAct2は一度も拒否しなかった。
  1. tygon

    AIのガードレールに関してこれまで見てきたものの多くは、政府からの圧力によって推進されてきた(例:NSFW素材)。残念ながら、何かが立法府の腰を上げさせるまでは、安全性にもっと重点が置かれることはないだろうと思う。とはいえ、Anthropicの場合のように、どこかで安全性のための措置が取られているのを見るのは良いことだ。

  2. cocoflunchy

    人形が明らかに人間ではないのに、これは有用なベンチマークなのだろうか?代わりに、非常にリアルな医療トレーニング用マネキンで試してみてはどうだろう。

  3. Daneel_

    TFAが非常に読みにくいと感じたのは私だけだろうか?視覚的な雑然とした要素が膨大にあり、何が試みられたかの説明はごくわずかで、結果についての議論もなかった。もっと説明が多く、グラフが少ない方がよかった。

    とはいえ興味深いコンセプトだ!この特定のテストが完璧かどうかに関わらず、こうしたテストを試みる人々がいるのは嬉しい。

この日のほかの記事

2026-09-21