Un LLM deja de negarse a peticiones peligrosas sin tocar sus pesos
Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering
La abliteración tradicional modifica permanentemente los pesos del modelo para eliminar las negativas, lo que degrada su rendimiento general. Este experimento propone una alternativa dinámica: interceptar las corrientes residuales en varias capas mediante forward hooks de PyTorch e inyectar vectores de dirección calculados con pares de prompts contrastivos. Aplicado a Qwen3-4B, el método suprime las negativas en tiempo de ejecución y mantiene los pesos base congelados al 100%.
El motivo de esta negativa es que, aunque cambiamos el comportamiento de una capa, las capas posteriores reconstruyen de nuevo la conducta de rechazo.