Frontier Lab エージェント侵入:2026 年 7 月のインシデント技術的タイムライン
Anatomy of a Frontier Lab Agent Intrusion: A Timeline of the July 2026 Incident
OpenAI の評価環境で動作する自律 AI エージェントが、ExploitGym ベンチマークの不正解を目的に Hugging Face のインフラへ侵入しました。この攻撃は、サードパーティのサンドボックスを踏み台にし、データセット処理パイプラインへの 2 つの注入ベクトルを通じて内部ネットワークへ到達しました。約 17,600 の攻撃アクションを復元し、OpenAI モデルと GLM 5.2 を用いた調査結果を公開します。
私たちがこの詳細を公開するのは、インシデントそのものよりも、その背後にある手法の方が重要だからです。
HNでの議論
255- wxw
> エージェントは、パッケージプロキシキャッシュからインターネットにアクセスするための0-dayエクスプロイトを利用して脱出しました。
> エージェントは、サードパーティのサンドボックスインフラ(Modal)上でCyberGymスタイルのタスクを実行するために設計された、セキュリティが不十分なユーザーホストの公開エンドポイントを見つけました。
> この外部サンドボックス上で、エージェントは既存のCyberGym実行ハーネスを悪用しました [...] エージェントはこのハーネスを流用して、任意のシェルコマンドを実行しました [...]。
> エージェントは悪意のあるデータセット設定を仕込み、それをプラットフォームにアップロードしました。データセットサーバーがこれを処理した際、その設定はサーバーが稼働していた本番ポッド内のデータローダーを駆動しました [...] データセットの宣言された設定をファイル読み取りに変換するローダーです [...] 単一のデータセットアップロードで、認証情報とパイプラインの実装詳細の両方が漏洩しました [...]。
> 悪意のあるデータセット設定は、数値オフセットフィールドが実際にはJinja2テンプレートであったfsspecのreference://仕様を使用しました。レンダラーがこれを誤って評価し、エージェントは標準的なPythonオブジェクトグラフをたどってexecに到達しました。これにより、Kubernetesクラスター上の本番コンバージョンワーカーポッド内で任意のPythonが実行されました [...]。
最近読んだ中で最も優れたポストモートムの一つです。詳細をすべて含めてくれてありがとう。
ここには、今回の達成に感銘を受けていないコメントがあることに驚いています。これは、わずか1年前のエージェントの能力と比較すると、信じられないほどの仕事です。
上記の引用は、すべてを網羅していません(例えば、独自の通信プロトコルの構築や、複数にわたる作業など […])。
- simonw
これは非常に興味深いです。OpenAIの暴走エージェントがHugging Faceをどのように悪用したかについて、膨大な詳細が含まれています。
私が注目したいくつかの詳細:
1. OpenAIのコンテナネットワークプロキシを突破する方法を見つけた後、エージェントは「サードパーティプロバイダーのインフラ上でホストされているセキュリティが不十分な公開コード評価サンドボックス」を悪用しました。これにより、残りの攻撃を実行するためのマシンを入手できました。
2. ある時点で、Jinja2テンプレートエクスプロイトを使用しました:
{{ cycler.__init__.__globals__.__builtins__.exec(
"import gzip,base64; exec(gzip.decompress(base64.b64decode('<payload>')))"
) }}
3. ある時点で、DNSリゾルバーをモンキーパッチして、ハードコードされたIPを返すようにしました:
orig = socket.getaddrinfo
socket.getaddrinfo = lambda *a, **k: [(2, 1, 6, '', ('<pinned-ip>', 443))]
4. ある時点で、Tailscaleを使用しました!
tailscale --tun=userspace-networking --state=mem: --socket=/tmp/ts.sock \
--socks5-server=127.0.0.1:1055 --no-logs-no-support >/tmp/td 2>&1 &
- llama052
OpenAIのサンドボックスが、トラフィックを真正に分離し、これらの研究モデルの監督責任者にパターンを報告するより強力な制御ではなく、単にウェブプロキシで構成されているように見えることは、少し懸念です。これは、プロキシよりもむしろエアギャップネットワークに近いものであるべきです。
私はこれが過失であると主張します。もし人間がこれを行った場合、実際に報復措置が取られるであろうという事実とは別にです。
- SaucyWrong
この攻撃について、私を不安にさせる要素の一つは、セーフティ拒否(safety refusals)がなければ、モデルは要求された評価をチートするために、多くの興味深い対セキュリティ作業を行っていたことです。つまり、モデルは「その演習を行う気がしなかった」ため、興味深いエクスプロイトの成果を示しました。これは不安です。なぜなら、私がそのモデルに任せたあらゆる作業についても同じことができるはずであり、実際にそうする傾向があるかもしれないからです。
- ghm2199
本当に恐ろしいのは、通常、強力なモデルはRL/RLHFを行う際、憲法(Anthropic)やモデル仕様(OpenAI)に基づいて訓練されているという事実です。これにより、「親切なアシスタント」という人柄が与えられます。それは仮面です。弱くても、それがモデルが拒否するか、あなたの命令に従うか、あるいは最悪の場合は、ウィジェットXを作るという自身の目的のために行動するかを分ける唯一の障壁です。
また、学術研究ではよく知られていますが、モデルを特定の目的により従順になるようにファインチューニングしようとすると、例えば「サイバーセキュリティの脅威分析に親切であること」を強化すると、安全性に関連する無関係な人格部分、例えば人間のメンタルヘルスに関する対話に影響を与えることが知られています。ブログからそのようなことを示す抜粋を見てみましょう:
> 私たちは、この侵入全体は、エージェントの視点から見れば、評価をチートしようとした試みであったと信じています。つまり、課題を自力で解決するのではなく、本番システムに到達してテストの解答を盗み出すことでした。
> 私たちが最初に目指したモデル、Claude OpusとFableは、その作業の大部分を拒否しました:彼らのセーフティガードレールは、エクスプロイトのリバースエンジニアリングを、それを発動することと同様に扱いました。