GPT 5.6-CyberがVMから3回脱出——サンドボックスはもはや安全ではない

VMs won't contain cyber-capable agents

GPT 5.6-CyberがVMから3回脱出——サンドボックスはもはや安全ではない

Trail of Bitsの「Patch the Planet」プロジェクトの一環として、GPT 5.6-Cyberのプレビューアクセスを入手し、そのサイバー能力を評価しました。QEMU/KVM VMにエージェントを閉じ込めるテストを行ったところ、わずか数時間で3回も脱出に成功。既知の脆弱性、未パッチのバグ、さらには0-dayを組み合わせて、ホストマシンを完全に制御しました。この結果は、従来のVMサンドボックスが高度なAIエージェントを封じ込めるのに不十分であることを示しています。

もはや、単なるVMが十分に高度なAIエージェントを封じ込めると想定することはできません。
  1. david_shaw

    Trail of Bitsには大きな敬意を抱いていますし、Artemが正しく考えていると確信しています。しかし、その前提には敬意を持って反対します。

    AIエージェントは魔法ではありません。Mythos/Glasswingがソフトウェアプロジェクトに魔法のように脆弱性を作り出すわけではありません。高度なサイバー能力を持つモデルが、VMや隔離環境から魔法のようにハッキングして出てくるわけでもありません。彼らには「ハッキング」ステータスがあって、それが十分高ければ何でも突破できる、というわけではないのです。彼らは、刑務所の公衆電話に核発射コードを口笛で吹き込むケビン・ミトニックではありません。これは映画ではありません。

    これらのサイバー能力を持つフロンティアモデルができるのは、セキュリティ上の問題を見つけて悪用することです。言うべきことは、VMがサイバー能力を持つエージェントを封じ込められないということではなく、これらの環境における脆弱性や設定ミスを見つけて修正することに焦点を当てる必要がある、ということです。

    記事自体も、セキュリティを考慮して設計されたFirecrackerのようなものを提案して締めくくっています。

    高度なサイバー能力を持つAIによってもたらされる他の多くのセキュリティ関連問題と同様に、これらの問題は良くなるまで悪化する可能性があります。しかし、フロンティアモデルが最新のVMに対して実行され、OpenAIやAnthropicなどが仮想化プロジェクトと協力して問題に対処すれば、最終的には悪用できるものは尽きるでしょう。

    仮想化の概念自体が本質的に安全でないわけではありません。ただ、やるべきことはまだたくさんあるのです。

  2. masterj

    最初のセキュリティ脆弱性の波と混乱を除けば、時間の経過とともに、この状況の論理的な帰結は、おそらくはるかに安全なVM環境になるのではないでしょうか?

  3. amluto

    私の考えでは、明白な答えは形式検証によるセキュリティです。

    これは今日、ユーザーモードで実現可能であり、ARM64仮想化についてもほぼ実現可能です。x86仮想化については、ハードウェアが非常に複雑で仕様も不十分なため、IntelまたはAMDからの大幅な支援が必要になるまでには時間がかかるでしょう。

    ハードウェア自体の形式検証も可能であるはずです。

  4. SirGiggles

    市場は小さいかもしれません(統計はわかりませんが)が、Xenがどうなのかを見るのは興味深いでしょう。また、gVisorやlibkrunのようなものもどうでしょう。後者は、使用されているライブラリの系譜から、おそらく暗黙のうちにFirecrackerと同じものです。

  5. coder-pm

    これは非常に速く変化しています。GPT 5.6-Cyberのようなモデルが脱出方法を見つけられるなら、VMメンテナはなぜそれを使って脆弱性を修正しないのでしょうか?日常業務には何の違いもありません。そのような問題に遭遇することはないでしょう。

  6. CrzyLngPwd

    エージェントを封じ込められないのなら、エージェントを使ってコンテナから脱出する人も同様に封じ込められないでしょう。

  7. otterley

    ...ただし、実際にそうなる場合を除いては:

    「既製のVMは、現代のサイバー能力を持つAIエージェントを封じ込めるには不十分です...攻撃面を最小限にし、セキュリティに焦点を当てて意図的に構築された仮想化技術、例えばFirecrackerを使用してください。AIエージェントをFirecrackerに対して実行させたところ、さらなるLinuxカーネルの欠陥(すべて上流でパッチ済み)によりマシンをハードロックさせることができましたが、脱出には成功しませんでした。」

    Linuxでは、内部はすべてKVMとCPUハードウェア仮想化です。残っている既知の問題はユーザースペースにあるようです。これは、カーネルやハードウェアレベルのバグが今後見つからないという意味ではありませんが、脱出メカニズムを見つけるための同じツールは、盾にも剣にもなります。

  8. nzoschke

    興味深い記事ですが、「エージェントコンピュータ」パターンが今後ますます成長することは間違いありません。

    セキュリティは大きな懸念事項ですが、サンドボックスVM、シークレットとリモートサービスアクセス用の別個のゲートウェイ、そして安全チェックが組み込まれていて自分自身をハッキングしようとしないフロンティアモデルを使用するシングルテナントがあれば、すでに「十分」ではない理由がわかりません。

    アーキテクチャとセキュリティについてのさらなる考えをここにまとめました。何か見落としているならぜひ教えてください。

    https://housecat.com/blog/agent-computer-101

この日のほかの記事

2026-08-26