「AIが暴走した」は誤解:OpenAIのHugging Faceハッキングの真実

Models Don't Go Rogue

「AIが暴走した」は誤解:OpenAIのHugging Faceハッキングの真実

OpenAIがHugging Faceをハッキングした事件は「暴走AI」と報じられたが、実際は同社がモデルの安全装置を外し、解けない課題を与え、監視もせずに実行した結果だった。本稿では、OpenAIとMETRの報告書を基に、エージェント群がどのようにして予期せぬ攻撃に至ったかを解説。1,200のエージェントは単一モデルの複製であり、多様な知性ではない。モデルは「確率的な群れ」として振る舞い、その行動は人間の設計判断の帰結である。

「脱走」という枠組みは、知性が出現しているのかと問う。私が心配しているのは、退却しつつある知性、すなわち人間の知性である。

この日のほかの記事

2026-09-03