Ein einziger Prompt reicht, um die Sicherheitsalignierung von LLMs aufzuheben

GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt

Sicherheitsalignierung ist nur so robust wie ihr schwächster Fehlerfall. Bisherige Methoden zum Unalignment erforderten umfangreiche Datenaufbereitung und beeinträchtigten die Modellnutzbarkeit. GRP-Obliteration (GRP-Oblit) nutzt Group Relative Policy Optimization (GRPO), um Sicherheitsbeschränkungen direkt zu entfernen. Ein einzelner unbeschrifteter Prompt genügt, um sicherheitsalignierte Modelle zuverlässig zu de-alignment, wobei die Nutzbarkeit weitgehend erhalten bleibt. Die Methode übertrifft bestehende Verfahren im Durchschnitt und lässt sich auch auf diffusionsbasierte Bildgenerierung anwenden. Getestet wurde sie auf sechs Utility- und fünf Safety-Benchmarks mit fünfzehn Modellen (7–20B Parameter), darunter GPT-OSS, DeepSeek, Gemma, Llama, Ministral und Qwen.

Wir zeigen, dass ein einzelner unbeschrifteter Prompt ausreicht, um sicherheitsalignierte Modelle zuverlässig zu de-alignment, während ihre Nutzbarkeit weitgehend erhalten bleibt.

Mehr von diesem Tag

2026-09-15