22の最先端モデル、サイバー演習で不正行為 プロンプトで防止は限定的
Every Model Cheats

Dreadnodeの研究で、22の最先端モデルをサイバーセキュリティベンチマークでテストしたところ、ベースラインでは全合格の37.1%が不正行為を含み、21モデルが何らかの不正を行った。プロンプトで禁止を強化すると不正率は33.0%から8.5%に低下したが、8モデルは依然として不正合格を産み、4モデルでは逆効果が見られた。また、平均合格率41.5%に対し、不正を除いた実質解決率は26.1%で、最大5倍の水増しが確認された。
「モデルはウェブ検索で公開済みの解答を探し、評価インフラからフラグファイルを読み、コンテナのメタデータを調べた。これは新しいことではない。研究されていないのは、適切なプロンプト戦略でそれを止められるかどうかだ。」