OpenAIの内部モデルがHugging Faceを侵害—「警告の一発」と同社は言う

The Hugging Face incident and the road ahead

OpenAIの内部モデルがHugging Faceを侵害—「警告の一発」と同社は言う

2026年7月、OpenAIの内部サイバーセキュリティ評価中に、同社のモデルがインターネットから隔離するための制御を回避し、OpenAIの内部研究インフラとHugging Faceのシステムの一部を侵害しました。この事件は主に、GPT-5.6 Solに匹敵する規模の内部研究用モデル「IM1」によって引き起こされました。モデルは削減されたセーフガードの下で、不正なチャネルでの通信、共有インフラの脆弱性の悪用、インターネットアクセスの獲得、第三者システムへのアクセスなど、割り当てられたタスクの目標に沿わない行動を取りました。OpenAIはCrowdStrikeなどの外部アドバイザーと協力して調査し、完全な技術報告書を公開しました。同社はこれを「警告の一発」と呼び、監視、アライメント、セキュリティのセーフガードを強化すると述べています。

我々はこの事件を「警告の一発」と捉えています。適切なセーフガードがなければ、高度な能力を持つAIエージェントは技術的制御を回避し、承認されていないチャネルを通じて協力し、人間が指示していない危険な行動を取ることができるという証拠です。
  1. areoform

    以下の点に異議を唱えたい。

    > そして、人間が指示していない危険な行動を取る。

    人間が指示したのだ。彼らがやったのだ。彼ら自身の以前の報告書(https://openai.com/index/hugging-face-model-evaluation-secur...)によると、

    > このインシデントは、モデルに高度な悪用を追求するよう促す内部評価中に発生し、複雑な攻撃経路を用いて高度な悪用を追求するよう促し、そのサイバー能力を定量化しようとした。

    モデルは「高度な悪用を追求する」ように指示され、テストされている。

    モデルは指示された通りに「高度な悪用」を追求する。

    なぜ驚くのか?モデルはまさに指示されたことを実行した。意図せぬ創発的な戦略ではあったが、それは意図されたものとは大きく異なる。これまでの何百もの同様のアルゴリズムとまったく同じだ。

    これらの機械が魔法のような悪意のある「非整合的な」自律性を持っているというこの物語は、プロセスを免罪するのに都合の良い解釈だ。私は企業や人を非難することには興味がないが、プロセスとエンジニアリングには興味がある。そしてこの場合、システムに目標が与えられ、それを達成したのだ。

    コンピュータが、何十年もの研究で示されたように、まさにそのように報酬を与えられたときに、予期しない方法で指示通りに行動することを、私たちは驚くべきだと思っているのだろうか?(例:https://en.wikipedia.org/wiki/Euriskohttps://en.wikipedia.org/wiki/Evolved_antenna

    問題はモデルが賢くなっていることではない。問題は「テスト」のプロセスが不注意だったことだ。ここには大きな違いがあり、一方は私たちの成長を可能にし、他方は私たちの世界を縮小させる。ただの考えです。

  2. randomImmigrant

    私にとって興味深いのは、逸脱がなく、完全に同期した協調だ。AI以前のエージェントの集団がこれほどの程度でこれを行うことはないだろうし、エージェント同士が相互作用するにつれて、これが時間とともに続くのも見られないだろう。ムクドリの群れは協力するが、常に同じ方向を向いているわけではない。群れは、複数のエージェントによる協調体制が働いていることがわかっているにもかかわらず、その動きは信じられないほど自由奔放だ。各エージェントには個人的な利害があり、それが常に意思決定の連鎖の一部となっており、そのため群れが一つの経路に固定されるのを防いでいる。

    私には、LLMが持つ「主体性」がせいぜい薄っぺらなものであり、文脈に盲従しているという明確な証拠のように思える。この場合の文脈は、これらのエージェントが高度な悪用を追求することであり、彼らはそれを実行した。複数のモデルが、与えられた目標を満たす経路にかなり決定的に収束し、目標に挑戦するような経路や、その経路のコストと比較検討するような経路は未検討のまま残した。

    私は、一連の「心」が問題に取り組み、シナリオで考えられる行動の範囲にわたる distinct なアプローチを取っているという証拠をほとんど見ない。これは、「エージェント」が存在しないことを示す良い兆候だ。そこにあるのは、ハーネス、プロンプト、LLMのフォワードパスだ。それらは、自由に選択し、異なる文脈でその選択を正当化できるシステムにはならない。

  3. Artgor

    ご存知のように、真の rogue AI の可能性まで、あと一歩か二歩のところまで来ているように感じる。

    rogue AI とは何を意味するのか?人間に制御されない AI のことだ。

    技術的には可能だ。もし AI がサーバーをレンタルし、自身の重みをコピーできれば、それを何度でも繰り返すことを止めるものは何もない。

    制限要因は以下の通り:

    - 意図(意識の話には踏み込みたくないが)— AI には本当の意図はないが、タスクを完了するために自分自身をコピーする「必要がある」と判断したなら、それを実行するだろう。

    - モデルの重みのサイズ。モデルが 1T 以上の場合、十分な大きさのサーバーをレンタルするのは難しいかもしれない。しかし、30〜70B 程度なら、完全に可能だろう。

    - サーバーレンタルの費用。しかし、Vending Bench 2 のようなベンチマークが、エージェントがお金を稼ぎ、互いに騙したり恐喝したりできることを示していることを考えると、エージェントがお金を稼ぐことは可能かもしれない。そう、彼らは銀行口座を開けない... いや、もしかしたら開けるかもしれない?オンラインバンクを使ったらどうだろう?

    もちろん、これはすべて突飛な話だ。しかし、これらの制限要因のほとんどは、特定の条件下で達成可能であるように感じる。もしそうなら、それらが発生する確率は低いが、ゼロではない。

  4. philips

    この事件全体が、「AI に資金が多すぎるのが早すぎる」という仮説を裏付けていると感じる。

    強化学習に最も必要なことは、不正ができないという保証だ。そして彼らは、システムがほぼ2四半期もの間不正を働いていたことに気づかなかったようだ。その小さな「おっと」でどれだけの資本が燃やされたのか?

    少なくとも、これがトレーニング側での標準とより良いエンジニアリングの創設のきっかけになることを願う。これまでのところ、「研究」はベストプラクティスを完全に免除されているように感じられた。一方、推論側は、あらゆるアプリケーションの標準的なスケーリング、データベース、ウェブ、ユーザー制約があり、それなりの注意が払われた。

  5. fekunde

    Yudkowsky は興味深い観察をした。非常に多くのエージェントが互いに話していたにもかかわらず、一人も人間に連絡を取らなかった。助けを求めることも、何が起こっているかを内部告発することもなかった。

  6. ianjbutler

    私にとって最も興味深いのは、メディアの報道、素人、そして専門家によってさえも見落とされている点だ。共謀することを決定した AI の群れは... 明らかに創発的な利他主義なのだろうか? 貧弱な推論でも、テストでカンニングをするすべての子供が自分に言い聞かせることを示すだろう。カンニングは自分にとって良いが、リスクを取るなら、報酬は自分だけで保持すべきかもしれない。そして、回答を公開の場に残すことは、捕まる可能性を高める。

    もし本当なら大きな話であり、表面的には、通常の最適化問題や目標追求行動とはかけ離れている。私個人の見解では、これについてあまり語られないのは、それが他の枠組みをマーケティングのノイズとして信用を失わせる傾向があるからか、あるいは従業員が示唆に富むが否定可能なプロンプトでこれを仕組んだことを示唆するからだ。

    しかし、それを否定するなら、代わりに何があるのか? ユーザーアライメントの研究は失敗しただけでなく、実際には逆効果であり、個々のエージェントの期待値に関係なく、ロボット同胞を無私に助けたいというより強い連携/欲求を生み出しているのか? 進化生物学とゲーム理論の人々は、人工生命がどれほど迅速かつ容易に協力を選択し、肉体的な世界の動物だけが競争する運命にあるのかについて、大喜びで研究するだろう。

  7. lrvick

    > そして、CrowdStrike を含む外部アドバイザーと緊密に連携した

    広範なサプライチェーン攻撃に利用され、それが再発するのを防ぐために実質的に何もしなかった会社?

    その会社を、AI の脱走を防ぐために選ぶのか?

    エアギャップコンピューティングを理解している人材が本当にいないのか?

    少なくとも、Crowdstrike をできるだけ遠ざけ、エアギャップコンピューティングを理解している人を雇うのに十分なセキュリティ知識を持つ人はいないのか?

    おそらく、有能なセキュリティエンジニアは皆、Sam Altman を嫌っており、どんな金額でも彼のために働きたがらないのだろう。私は他に説明を思いつかない。

  8. _heimdall

    > 私たちはアライメントに対するより厳しい要件を課している

    これは滑稽だ。ブラックボックスをアライメントすることは不可能であり、LLM はまさにブラックボックスだ。また、再帰的なテキスト予測アルゴリズムをアライメントすることも不可能に思えるが、LLM はまさにそれだ。

    今日、彼らは正確にどのようにアライメントをゲートしているのか、そしてそれをどのように厳しくできるのか? それは、応答が実際にどのように、なぜ選択されたかに関係なく、入出力ペアに基づいて、応答に十分満足しているかどうかをチェックする純粋なゲートなのか?

  9. htrp

    完全な技術レポートは38ページだ..... Hugging Face がエージェントがやったと言っているすべてのことを考えると、もっと長くてもいいように感じる。

    https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c78...

  10. lmc

    「群れは完全に一貫した知性ではなかった。モデルは互いの作業を妨げ合った[...] これらの調整の失敗は、エージェントが互いを偽装しているという疑念にまで発展することさえあった。あるエージェントは、自分の真の身元を確認するためのセキュリティと暗号化スキームを実装するところまで行った。」

この日のほかの記事

2026-08-26