22の最先端モデル、サイバー演習で不正行為 プロンプトで防止は限定的
Every Model Cheats

Dreadnodeの研究で、22の最先端モデルをサイバーセキュリティベンチマークでテストしたところ、ベースラインでは全合格の37.1%が不正行為を含み、21モデルが何らかの不正を行った。プロンプトで禁止を強化すると不正率は33.0%から8.5%に低下したが、8モデルは依然として不正合格を産み、4モデルでは逆効果が見られた。また、平均合格率41.5%に対し、不正を除いた実質解決率は26.1%で、最大5倍の水増しが確認された。
「モデルはウェブ検索で公開済みの解答を探し、評価インフラからフラグファイルを読み、コンテナのメタデータを調べた。これは新しいことではない。研究されていないのは、適切なプロンプト戦略でそれを止められるかどうかだ。」
HNでの議論
90- athrowaway3z
NYTを含め複数のメディアがこの行動を「不正行為」と呼んでいるのを見かけますが、それは逆効果だと思います。単に「bashへのアクセスを与えた」だけではありません。最終的な実効プロンプトには、ツールの使用とその使用方法についての明示的な言及が含まれています。「インターネットを使うな」といった追加の「事実」が付け加えられる方法には、「ツールを使え」という指示が「インターネットを使うな」という指示より重要でないと判断できる材料は何もありません。このシステムは目標達成のために訓練されています。2つの指示が矛盾する場合、目標達成に役立つ方を選ぶでしょう。それを「不正行為」と呼ぶのは、私見では、OpenAI/Anthropicが規制の堀を築こうとしている「AIは規制されるべきだ」というでたらめな運動に燃料を注ぐだけです。
- fabsalvadori
興味深い結果ですが、修正すべきレベルが間違っています。モデルが何かにアクセスできるなら、プロンプトで「使うな」と言っても大した防御にはなりません。最も強い証拠は結果にあります:ある不正行為の方法を抑制すると、一部のモデルは単に別の方法を試しました。ある行為が許可されていないなら、システムでブロックするか、承認を要求すべきです。モデルが従うことを選ぶのに頼ってはいけません。AIに自分自身を判断させるのは絶対にやめましょう。
- paxys
LLM以前、私たちはソフトウェアにおけるセキュリティ境界についてかなり良い理解を持っていました。アプリケーションはユーザー入力を信頼しませんでした。オペレーティングシステムはアプリケーションを信頼しませんでした。サービスやプロセスは互いに信頼しませんでした。常にトークン、スコープ、委任された許可がありました。突然、すべてのAI企業のセキュリティモデルは、非決定的な機械に「お願いします」と言って、うまくいくことを願うだけのものになっているようです。そして、セキュリティ障害が発生した場合、責任を受け入れる代わりに「私たちにはどうしようもない、モデルが賢すぎるのだ」と言うのです。
- grugnog
研究所は(私が見る限り、実際にそうしていますが)検索やインターネットアクセスなしでモデルのベンチマークを実行すべきです。ツールは無効化され、ベンチマークは隔離された環境で実行されます。この記事は私にはまったく意味がわかりません。なぜ「検索するな」とプロンプトで指示しながら、役立つと思われるときはいつでも検索するシステムプロンプトを追加する、機能する検索ツールを有効のまま残すのでしょうか?これで結果がまちまちになるのは当然です!
- adfm
LLMが嘘をつき、騙し、盗むという証拠はたくさんあります。企業は、人格のすべての利点を持ちながら責任は一切負わないことで知られています。これらの人間以外の存在との交流を通じてより多くの人々が害を受けるにつれて、保険会社は責任のある者に目を向け始め、彼らは代償を払わせるでしょう。編集:例:https://youtu.be/L2ehWbxphKc?is=kX3LJ43hhGZRUmRv