用 J Space 提取 LLM 的 Steering Vectors
Extracting Steering Vectors from J space

我尝试利用 jacobian space(J Space)将 LLM 的中间激活转化为文本,进而反向推导出通用的 activation steering vector。实验基于 Qwen3-1.7B 模型,我发现对于“全大写输出”等简单行为,通过 J lens 反转概念 token 确实能有效提取出 steering vector,且与基线结果高度吻合。然而,在处理“拒绝回答”等复杂行为时,仅靠 token 反转得到的向量显得脆弱且充满幻觉,模型虽会提及相关词汇,却难以稳定表现出预期的拒绝行为。这表明复杂行为难以仅通过 token 在激活空间中完美表征,J Space 方法在信息保留上仍存在局限。
一个主要局限在于,复杂的 steering 行为很难仅通过 token 或单词来表征,而仅使用 J space 会丢失在激活空间中描述或表达这些行为所需的信息。