Dynamische Abliteration: Wie ein Forscher die Verweigerung von Qwen3-4B ohne Gewichtsänderung abschaltet
Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering
Herkömmliche Abliteration entfernt Verweigerungsrichtungen dauerhaft aus den Gewichten eines LLM und riskiert dabei Leistungseinbußen. Madhukar Phatak zeigt an Qwen3-4B, wie stattdessen PyTorch-Forward-Hooks die residualen Zwischenströme zur Laufzeit über mehrere Layer manipulieren. Ein einzelner Vektor auf Layer 14 genügt nicht, da nachgelagerte Layer die Verweigerung rekonstruieren. Erst kontrastive Differenzvektoren über die Layer 12 bis 20 unterdrücken das Verweigern zuverlässig – bei 100 % eingefrorenen Basisgewichten.
Der Grund für diese Verweigerung ist, dass die nachgelagerten Layer das Verweigerungsverhalten erneut rekonstruieren, obwohl wir das Verhalten einer einzelnen Schicht geändert haben.