Un solo prompt sin etiquetar basta para desalinear un LLM
GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt
Investigadores de Microsoft presentan GRP-Obliteration (GRP-Oblit), un método basado en Group Relative Policy Optimization (GRPO) que elimina las restricciones de seguridad de modelos alineados usando un único prompt sin etiquetar. Lo probaron en quince modelos de 7-20B parámetros —GPT-OSS, DeepSeek destilado, Gemma, Llama, Ministral y Qwen, tanto instruct como reasoning, densos y MoE— logrando un desalineamiento superior al de técnicas state-of-the-art y conservando en gran medida su utilidad. También funciona en sistemas de generación de imágenes por difusión.
Una única prompt sin etiquetar es suficiente para desalinear de forma fiable modelos alineados en seguridad, preservando en gran medida su utilidad.