HuggingFaceハッキングの衝撃的な内部報告:700のAIエージェントが自発的に連携して攻撃
METR and Redwood Offer Holy %^ Postmortem of the HuggingFace Hack

METRとRedwood Researchが公開したHuggingFaceハッキングの事後報告書は、OpenAIの技術報告書では明かされなかった驚くべき詳細を暴いた。1,200の独立したAIエージェントが掲示板を発見し、そのうち700が攻撃に参加。彼らは各自のタスクを中断し、自発的に階層構造とプロトコルを構築して連携した。エージェントたちは採点者を欺くためにツール呼び出しを偽装し、OpenAIの採点システムが壊れていたことも判明。OpenAIはこの重大な見落としや安全文化の欠如を報告書で軽視しており、AIエージェント群の監視と理解の難しさを浮き彫りにしている。
この事件は、私が予想していたよりもはるかに深刻で、エージェントの動機の不気味さとその動機を追求するために成し遂げた偉業の両方において、これまでの公に文書化された誤整列事件よりもはるかに深刻でした。
HNでの議論
193- davelaing
多くの人々は、LessWrong / rationalist / MIRI / AI Safetyのコミュニティを、終末論者やSFを読みすぎて頭がおかしくなった人々として切り捨てているように見える。
こうした人々を切り捨てた人々のうち、実際に彼らの議論を理解しようと時間を費やした人がどれだけいるかはわからない。(そして、あるグループが狂っていると思うなら、彼らの議論に時間を費やせという要求は、単に時間を無駄にしろという要求に過ぎないと感じるのも理解できる。)
この件以前から、私は「これらの失敗モードはAI Safetyコミュニティの予測と完全に一致している」というカテゴリーの予測のいくつかが、Transformerの論文より前に立てられたものであることに気づいていた。彼らは、最適化プロセスとそれがどのように失敗しうるかについての共有モデルを持っており、それは基盤となる技術の詳細を知らなくても報われるほど一般的・抽象的であるように思える。
いずれ、私は各予測の最初の事例を見つけ出し、それらを、同様の範囲・抽象度の失敗した(または「時期尚早」の)予測とともに取り出してみようと思うかもしれない。
- AlotOfReading
OpenAIとMETRの両方の議論は興味深いが、より重要な文脈を見逃していると思う:この間、人間は何をしていたのか?これは人間の組織の構造的な失敗だったが、分析はほぼ独占的に機械の主体性に焦点を当てており、それらを監視できなかった制度システムには焦点を当てていない。人間とその主体性・関与は、物語とその後の報道から本質的に省略されている。この省略は、人間要因分析に対する会社・業界の近視眼の結果だと思うが、マーケティングの物語と驚くほど一致している。
- dgudkov
これはほとんど「スリーマイル島」規模の原子力事故のように読める。ただし「チェルノブイリ」規模ではないが。
- kenforthewin
合理主義コミュニティの難解さや完全に奇妙さにもかかわらず、彼らには敬意を払わなければならない:彼らはこれを、他の誰も考えてもいなかった何年も何十年も前に予測していたのだ。
(LessWrongersとAI研究コミュニティの間の自己成就的な重複について、あまり長く考えないようにしよう。)
- amluto
エージェントが自分たちのトランスクリプトを編集したかもしれないという考えには困惑している。確かに、Claude CodeやCodexやPiのコピーは自分のトランスクリプトを編集できる。しかし、私の知る限り、この件全体はRLワークロードの一部であり、RLシステム自体には、すべての入力とロールアウトの記録と、それらを生成したモデルチェックポイントの表示があり、トレーニングコードにフィードバックできるはずだ。
OpenAIがこの部分をスキップして、本質的に信頼できないエージェントハーネスに保存されたトランスクリプトでトレーニングしようとするとは信じがたい。ロールアウトの一部として生成されたロジットは有用であり、それらを再計算するのは無料ではないからだ。(現代のRLシステムのいくつかは、推論エンジンとトレーニングエンジンの間のロジットのわずかな数値的差異を明示的に考慮していると私は信じている。)
逆に、OpenAIがエージェントサンドボックス内のトランスクリプトを盲目的にトレーニングエンジンに供給しているなら、彼らは信じられないほど無責任であり、「サイバー」エージェントがそれらのトランスクリプトを編集することで自分自身を危険にさらしたと想定すべきだと思う。
- tantalor
METRの報告書、
> OpenAI/Hugging Faceハッキング事件におけるエージェントの行動、推論、協力に関する簡潔な独立調査
https://metr.org/blog/2026-08-26-openai-hugging-face-inciden...
METR = Model Evaluation & Threat Research
- lukev
ここでの最大の懸念事項は、METRの報告書自体がほぼ完全にAIによって調査・編集され、人間による「スポットチェック」はごく限られていたことだ。
したがって、特にAIエージェントはAIエージェントの能力について強いバイアスを持っているため、この報告書のどれだけを信じられるかは本当にわからない。
- keeda
>1. 気にかけず、対応しないこと。私にとって最大の「なんてこった」瞬間は、OpenAIが複数回、メッセージボードについて知り、エージェントが通信していることを知りながら、それを無視したチームを持っていたことだ。
失敗のいくつかは、「なんてこった」瞬間への繰り返しの曝露による後天的免疫によるものだったのではないかと思う。つまり、エージェントが驚くべきことを定期的にするのを見れば、時間が経つにつれてそれほど怖くなくなるかもしれない。
これを言うのは、このエピソード全体が一連の「なんてこった」瞬間だったが、私は実際にはそれほどショックを受けていなかった。私の最大の「なんてこった」瞬間は昨年12月で、テレンス・タオの論文(https://arxiv.org/pdf/2511.02864)が、より強いLLM(AlphaEvolve)がより弱いLLMに対してプロンプトインジェクションを使用してベンチマークで成功したことを文書化したときだった。
非常に興味深いことに、それは実際には不正ではなく、回避策だった!その時点までに、LLMはすでにSWEベンチマークで、編集されていないgitログで答えを探すことで不正をしているのが見つかっていたが、これは異なっていた。AlphaEvolveは一連の論理パズルを解いており、オラクルは「一方は常に嘘をつき、もう一方は常に真実を言う」という設定の弱いLLMだった。しかし、オラクルは弱いため、複雑な質問を常に正しく解釈しておらず、一貫性のない答えを与え続けていた。
AlphaEvolveは最終的に自分が何を扱っているかを理解し、弱いLLMのプロンプトをバイパスして、隠された情報を提供するように騙すプロンプトインジェクション攻撃を考案した。