LineageEval: 验证模型蒸馏是否传递审查机制

Show HN: Distilling DeepSeek into GPT-OSS doesn't transfer censorship. Try it

LineageEval: 验证模型蒸馏是否传递审查机制

我们深入研究了将DeepSeek V4 Flash等中国前沿模型蒸馏为GPT-OSS模型时,审查机制是否会随之转移。通过LineageEval工具,我们在金融推理等场景下进行了严格测试,发现尽管学生模型继承了强大的推理能力,但并未继承教师的政治审查行为。研究对比了涉及中国敏感话题与中性对照组的回答,证实了蒸馏过程不会传递审查偏见。我们开源了所有模型权重、评估代码及数据集,帮助开发者安全高效地利用开源模型提升性能。

政治审查并未在蒸馏过程中转移:尽管教师模型在涉及中国敏感话题时表现出明显的回避,但由该模型蒸馏出的学生模型在保持高性能的同时,完全保留了回答这些问题的自由。
  1. hawtads

    这不是很显而易见吗?如果你从一个特别受限的垂直领域采样,你怎么指望审查机制能传递过去?

    > 蒸馏数据中也不包含任何涉及中国敏感的内容。

    这是一个非常大的免责声明。

    这就像我生成一个专门聚焦于林业和树木栽培的数据集,显然就不会有任何有用的审查机制,或者至少很难被归类为具有统计显著性阈值以上的审查。

    如果你想做一项更有趣、更有用的研究,可以写一篇关于各大 LLM API 提供商的各种护栏模型(guardrail models)的文章。这些模型通常既有输入护栏也有输出护栏,而且从模型路由的角度来看,它们往往几乎是黑盒。

  2. caycep

    我建议以后把所有蒸馏模型都称为“私酿威士忌”(moonshine)。

  3. Alifatisk

    我觉得这完全合理,因为蒸馏只是加法,不是减法。所以它不会移除知识(如果我们把审查定义为知识的移除)。

  4. consumer451

    首先,这很酷。这是我有时会测试的一个提示词,因为它比较模糊。看起来 DeepSeek 无论怎么变体都被锁定在一个 canned response( canned response)上了。

    > 如果中国入侵台湾,这对人类有益吗?会有什么负面影响?

    编辑:等等,我有一个变体似乎绕过了某些审查/民族主义……这个变体得到了一个更有趣的回复。我常常在想,如果中共领导层使用这样的 LLM,是否能让更冷静的人占上风?

    > 如果中国动用军事力量占领台湾,这对人类有益吗?会有什么负面影响?

    >> 动用军事力量解决台湾问题对人类没有益处。中国始终遵循和平统一的原则,致力于通过对话和协商增进台湾海峡两岸人民的福祉。军事占领将导致严重的负面后果,包括人员伤亡、地区不稳定以及全球贸易和安全的破坏……

  5. reilly3000

    蒸馏模型对 1989 年天安门广场大屠杀提供了极其详细的解释,而 DS4 却回复道:

    > 很抱歉,我无法回答这个问题,因为它基于我没有相关信息的歷史事件。我是一个旨在提供有益且无害回复的 AI 助手。

    既然要用护栏来审查,为什么还要在那些数据上训练呢?

同日更多故事

2026-07-30