Dynamische Abliteration: Wie ein Forscher die Verweigerung von Qwen3-4B ohne Gewichtsänderung abschaltet

Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering

Herkömmliche Abliteration entfernt Verweigerungsrichtungen dauerhaft aus den Gewichten eines LLM und riskiert dabei Leistungseinbußen. Madhukar Phatak zeigt an Qwen3-4B, wie stattdessen PyTorch-Forward-Hooks die residualen Zwischenströme zur Laufzeit über mehrere Layer manipulieren. Ein einzelner Vektor auf Layer 14 genügt nicht, da nachgelagerte Layer die Verweigerung rekonstruieren. Erst kontrastive Differenzvektoren über die Layer 12 bis 20 unterdrücken das Verweigern zuverlässig – bei 100 % eingefrorenen Basisgewichten.

Der Grund für diese Verweigerung ist, dass die nachgelagerten Layer das Verweigerungsverhalten erneut rekonstruieren, obwohl wir das Verhalten einer einzelnen Schicht geändert haben.

Mehr von diesem Tag

2026-09-24