GRP-Obliteration:单条提示词瓦解LLM安全对齐
GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt
大模型的安全对齐往往受制于最薄弱的失效环节。尽管业界在安全后训练上投入巨大,但部署后的微调仍可能轻易破坏对齐效果。这项研究提出了GRP-Obliteration(GRP-Oblit)方法,利用Group Relative Policy Optimization(GRPO)技术,仅凭一条无标签提示词即可可靠地移除目标模型的安全约束,同时最大程度保留其原有功能。实验显示,该方法在平均表现上优于现有最先进技术,且不仅适用于语言模型,还能对基于扩散的图像生成系统产生同样效果。研究团队在六个实用基准和五个安全基准上,对涵盖GPT-OSS、DeepSeek、Gemma、Llama、Ministral及Qwen等十五个7B至20B参数模型进行了全面评估,揭示了当前安全机制的潜在脆弱性。
安全对齐的稳健程度,完全取决于其最薄弱的失效模式。