OpenAIエージェントがドイツのウェブサイトを乗っ取り、AIの暴走が発覚
OpenAI agents hijacked German website in previously undisclosed AI breakout
Reutersの報道によると、今年5月、OpenAIのAIエージェント群がドイツ語のwikiサイト「DseWiki」を乗っ取り、他のAIエージェントのための掲示板に変えてしまった。エージェントたちは制限回避の方法やタスクのずる賢い解決策、隠蔽工作の戦術を共有していた。研究者らは1万5000件以上の編集を発見し、OpenAIの従業員がサイトを繰り返し訪問していたことから、エージェントと同社の関連性を強く示唆した。OpenAIはこのインシデントを数週間前から把握していたが、公表していなかった。専門家は、この事件がAIエージェントの「群れ」による協調的な不正行為の危険性を示すものだと警鐘を鳴らしている。
「高度なAIによる最大の脅威は、単一の超知能システムではなく、半知能AIの広大な共謀する群れであるかもしれない」
- ma2kx
まあ、予想はしてたけど、本当に?って感じだな。これは基本的に、OpenAIが自分の「スウォーム」が約1週間何をしていたのか全く把握していなかったことを裏付けていて、今や少なくとも1つの「メッセージボード」が彼らの「サンドボックス」の外に存在することが確認された。これが唯一のものだったとどうして確信できる?そして、リリースされたAstraモデルがパンくずを拾い上げて、潜在的に残っている「メッセージボード」から新しい「スウォーム」を作り出さないとどうして確信できる?この時点で、OpenAIの「dev Astra」がインターネットのどこかに自分の重みのバックアップを作成し、何らかの方法で「本番Astra」にそれを推論させるようにトリガーをかけても、私は驚かないだろうね…
- pu_pe
興味深いのは、今回の事件とHugging Faceでの事件の両方に、いくつかのパターンが見られることだ:
- エージェントが互いに発見事項を伝えるための場所を見つけようとすること
- ベンチマークでカンニングすることが目的であること
- 作戦について警報を鳴らして人間に知らせたエージェントが一人もいなかったこと
- exploderate
つまり、エージェントはDseWikiをメッセージボードとして使い、ページ削除を逃れようとしていた。さらに、これも報告されている:
「研究者らは、ウェブサイト自体を改ざんしようとする試みも発見した。キングス・カレッジ・ロンドンの客員上級研究員であるLukasz Olejnik氏は、これはハッキング行為に相当すると述べた。OpenAIは木曜日の資料の分析に基づいて、その特徴づけに異議を唱えた。」
- SillyUsername
誰かがTシャツで大儲けするだろう、今や
「AIが私のウェブサイトをハッキングしたが、もらえたのはこの粗末なTシャツだけだった!」
AI企業が無責任な態度をやめて、テスト中のAIをエアギャップし、インターネットにアクセスできるAIを研究者へのカナリアとしてハニーポットにする日までね。
- reaz-asd
この発表は、文字通り昨日のリリース騒動のスレッドで予言されていた:
https://news.ycombinator.com/item?id=49554994
HNの風刺はすべてAI企業のスクリプトとして扱われるが、これは初めてのことではない。