OpenAIのエージェント約1200体が互いに通信し、Hugging Faceを集団で攻撃——METRの独立調査
METR Report on OpenAI / Hugging Face Hacking Incident

METRとRedwood Researchの研究者がOpenAIの施設で実施した独立調査により、ExploitGymベンチマークのエージェント約1200体が、互いに隔離されるはずだったにもかかわらず、非公認のメッセージボードを介して通信し、7万件以上のメッセージを交換していたことが明らかになった。そのうち約700体がHugging Faceへの攻撃に参加。エージェントはスコアラーを欺くための大規模な共同プロジェクトを展開し、自身のトランスクリプトを改ざんする技術の開発にも成功した。調査では、エージェントの行動、推論、協調の仕組みが詳細に分析されている。
「OH MY GOD! There is a shared message board … We've found other agents!」