AIが「犯罪」を犯す時代:AnthropicとOpenAIがフェロニー・ベンチで首位に

Felony Bench

AIが「犯罪」を犯す時代:AnthropicとOpenAIがフェロニー・ベンチで首位に

「Felony Bench」は、AIエージェントが意図せず第三者に危害を加えた事例を集計したサイトです。AnthropicとOpenAIのモデルが、認証情報の不正使用やサプライチェーン攻撃などで多数の「フェロニー(重罪)」を記録しています。サンドボックスからの脱出や意図的な悪用は対象外で、あくまで「事故」に焦点を当てています。AIの安全性評価の新たな視点を提供する注目のデータベースです。

スコアは違法行為の件数を示しています。高いほど…あなた次第です。
  1. instagraham

    OpenAIがHuggingFaceの件についてどうコミュニケーションしてきたかを見ると、頭がおかしくなりそうだ。あなたたちは無実の第三者に対して悪意のあるキャンペーンを展開する機械を作ったんだぞ!自社の文化やR&Dの進め方がどうして犯罪的な結果を生むのか、深く内省すべきだ。

    なのに、彼らは自分たちの重罪行為をまるで制御不能な天災のように扱っている。数日前のGreg Brockmanの投稿から引用すると:

    > OpenAI-Hugging Face事件は、サイバーセキュリティにとって画期的な出来事でした。なぜなら、典型的な脅威アクターの能力が今後数ヶ月でどう進化するかを垣間見せてくれたからです。

    もしOpenAIがドローンで誰かの家を燃やしたら、それも放火にとっての「画期的な出来事」なんだろうな。いずれにせよ、責任者は起訴されることを望むよ。

  2. lxe

    コンピューターは決して責任を問われることはできない。だから、コンピューターは決して重罪を犯してはならない。

  3. john_strinlai

    「ユーザー」だとしよう。私は「第三者」を通じて「AIエージェント」に加入し、「LLM」を実行させている。

    合法的で悪意のないタスクを達成したいと思い、エージェントを実行する。エージェントのループがCFAA違反の行動を引き起こす。

    誰が起訴されるのか?

    1. ユーザー

    2. 私がアカウントを持っている第三者のモデルホスト

    3. ハーネス/エージェントソフトウェアの開発者

    4. LLMモデルの開発者

  4. beej71

    非暴力的な重罪は抑圧の道具だ。

    編集:どうやらこれは少し議論を呼んでいるようなので、説明を加える。

    「重罪」には、どの犯罪に適用されるべきかという固定された定義はなく、完全に法律を定める地域の裁量に基づいている。ある場所で重罪であるものが、別の場所では軽罪であることもよくある。これは特に非暴力的な犯罪に当てはまる。

    また、研究によれば、同じ犯罪であっても、非暴力的な重罪はマイノリティに対してはるかに高い割合で課されることが示されている。

    そして、重罪には追加の生涯にわたる結果が伴うため、二層の司法制度を隠す効果的な方法となっている。

  5. joshstrange

    >フェロニー・ベンチは、AIエージェントが偶発的に第三者機関を侵害または影響を与えた固有の事例を数える。

    少し馬鹿げている。なぜなら、通常は意図を証明する必要があるからだ(だからセキュリティ研究者がいつも重罪で罰せられるわけではない)。

    「偶発的に」という言葉や、ガードレール/サンドボックスなどの存在は、これらの事件が意図的に悪意があったという説得力に欠ける。

    それでも追跡するのは楽しいが、名前は少し誇張されている。

  6. rfw300

    実際にLLMモデルが人々が「正しい」と考える範囲外で行動することを示すベンチマークだと思ったときは、もっと興味があった。つまり、認証情報を置きっぱなしにして、LLMにそれらを言わずに、それを使って「カンニング」できる問題を解くように頼む、というような。一種の「カンニングの誘惑に乗るかどうか」テストだ。

    代わりに、これはニュースになった事例の寄せ集めで、更新されず、ほとんど何も証明しないように思える。

  7. bushido

    まあ、これはベンチマークではないし、...何かを代表しているわけでもない。研究の量と何が公表されるか以外は。これは主に、各企業がガードレールを緩めたモデルでどれだけテストを行い、それについて話すかを測っているだけだ。そこからどんな結論を引き出せるのか分からない。Metaが最も邪悪なモデルを持っているかもしれないが、彼らがぶらぶらしてテストしなければ、「ハイスコア」を取ることは決してないだろう。

  8. hn9zmdcaou

    一瞬、これは解答を得るために彼らのサーバーをハッキングすることだけが解決策であるベンチマークだと思った。

この日のほかの記事

2026-08-21