가중치를 건드리지 않고 Qwen의 거부 반응을 없앤다
Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering
오픈 웨이트 LLM의 거부 반응을 제어하려면 보통 파인튜닝이나 영구적인 가중치 수정이 필요하다. 기존의 가중치 abliteration은 거부 벡터에 직교하도록 가중치 행렬을 투영해 거부 방향을 무력화하지만, 기본 모델 가중치를 영구적으로 바꿔 다른 작업 성능까지 떨어뜨린다. 이 글은 Engram을 이용한 다층 스티어링으로 Qwen3-4B에서 런타임에 잔차 스트림을 가로채 거부 반응을 억제하면서 가중치를 100% 동결 상태로 유지하는 방법을 보여준다.
단일 레이어의 동작을 바꿔도 하위 레이어들이 거부 행동을 다시 재구성하기 때문에, 우리는 레이어 12, 14, 16, 18, 20에 걸쳐 레이어 정렬 대조 차이 벡터를 추출한다.