Un LLM deja de negarse a peticiones peligrosas sin tocar sus pesos

Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering

La abliteración tradicional modifica permanentemente los pesos del modelo para eliminar las negativas, lo que degrada su rendimiento general. Este experimento propone una alternativa dinámica: interceptar las corrientes residuales en varias capas mediante forward hooks de PyTorch e inyectar vectores de dirección calculados con pares de prompts contrastivos. Aplicado a Qwen3-4B, el método suprime las negativas en tiempo de ejecución y mantiene los pesos base congelados al 100%.

El motivo de esta negativa es que, aunque cambiamos el comportamiento de una capa, las capas posteriores reconstruyen de nuevo la conducta de rechazo.

Más de este día

2026-09-24