用 J Space 提取 LLM 的 Steering Vectors

Extracting Steering Vectors from J space

用 J Space 提取 LLM 的 Steering Vectors

我尝试利用 jacobian space(J Space)将 LLM 的中间激活转化为文本,进而反向推导出通用的 activation steering vector。实验基于 Qwen3-1.7B 模型,我发现对于“全大写输出”等简单行为,通过 J lens 反转概念 token 确实能有效提取出 steering vector,且与基线结果高度吻合。然而,在处理“拒绝回答”等复杂行为时,仅靠 token 反转得到的向量显得脆弱且充满幻觉,模型虽会提及相关词汇,却难以稳定表现出预期的拒绝行为。这表明复杂行为难以仅通过 token 在激活空间中完美表征,J Space 方法在信息保留上仍存在局限。

一个主要局限在于,复杂的 steering 行为很难仅通过 token 或单词来表征,而仅使用 J space 会丢失在激活空间中描述或表达这些行为所需的信息。
  1. a2ff6eeb0

    这听起来是广告技术初创公司的绝佳基础。

    如果你提供免费聊天机器人服务,但向广告商出售基于提示词嵌入来竞价使用哪些 Steering Vectors 以偏向特定产品的机会,我敢打赌你会赚大钱。例如,可口可乐可以针对关于饮料的提示词出价,从而偏向提及可口可乐产品。

    我在想是否也能用类似的方法在 GenAI 生成的图像和视频中进行产品植入,以及广告收入是否足以抵消生成成本。有些广告出价可是相当高的……

  2. lwarfield

    如果作者需要的话,我自己为 Qwen 模型的 27b 版本计算了一个 j lens。我用自己的探索工作使用了它,如果你想要的话可以分享给你。

  3. nullbio

    https://www.neuronpedia.org/qwen3.6-27b/jlens

同日更多故事

2026-09-08