J 공간에서 스티어링 벡터 추출하기
Extracting Steering Vectors from J space

Jacobian lens(J lens)는 LLM의 중간 활성화를 토큰으로 해석하는 기법이다. 이 글에서는 J lens를 역이용하여 개념 토큰 몇 개만으로 일반적인 활성화 스티어링 벡터를 만드는 방법을 실험한다. Qwen3-1.7B 모델로 실험한 결과, 모두 대문자로 출력하는 것과 같은 단순한 행동은 잘 유도되지만, 거절(refusal)과 같은 복잡한 행동은 환각이 늘고 취약한 모습을 보였다. 저자는 코드와 결과를 공개했다.
J 공간에서 유도된 벡터는 복잡한 행동에 대해 환각을 일으키기 쉽고, 토큰/단어만으로 명확히 표현할 수 없는 행동에는 취약하다.