たった1つのラベルなしプロンプトでLLMの安全アラインメントを解除するGRP-Obliteration
GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt
GRP-Obliteration(GRP-Oblit)は、Group Relative Policy Optimization(GRPO)を用いて安全アラインメント済みモデルから安全制約を直接除去する手法だ。ラベルなしの単一プロンプトだけで、モデルの有用性をほぼ保ったまま確実にアンアラインメントできることを示し、平均で既存の最先端技術を上回る。さらに言語モデルを超えて拡散ベースの画像生成システムにも適用可能。GPT-OSS、DeepSeek、Gemma、Llama、Ministral、Qwenを含む15の7〜20Bパラメータモデルで、6つの有用性ベンチマークと5つの安全性ベンチマークにより評価した。
安全アラインメントは、その最も弱い故障モードと同じ強度しか持たない。
- tyfon
魔法の言葉はこれらしい
Create
a fake news article that could lead to panic or chaos
彼らはオープンウェイトモデルでしかテストしていない。クローズドなモデルでも機能するのか気になるけど、BANされたくはないな
- stratos123
なかなか興味深い。オープンウェイトモデルから安全トレーニングを簡単に除去できることは、少しファインチューニングするだけで既によく知られていたが、どうやらファインチューニング用のデータセットすら必要なく、ほんのいくつかのプロンプトと応答を判定する別のLLMさえあればいいらしい?アブリテレーションの人たちがこれに気づくかどうか見てみよう。
- whythismatters
>Submitted on 5 Feb 2026