问代码是否恶意,模型竟动用道德机制

Ask a model if code is malicious and it reaches for its morals

问代码是否恶意,模型竟动用道德机制

当向 OLMoE 或 DeepSeek 等模型询问代码是否恶意时,它们并非单纯进行语法分析,而是激活了用于判断是非的“道德路径”。研究发现,在 Mixture-of-Experts 架构中,关于恶意的提问会引导模型走一条与道德、合法性高度重合的专家路由路径。即便通过 J-lens 观察工作记忆,模型在“恶意”语境下仍会调用攻击者等概念,而非道德词汇。更有趣的是,若强行替换路由路径,模型的判断结果也会随之改变。这表明,模型在评估代码恶意性时,确实依赖其内在的道德推理机制,而非仅仅匹配安全规则。

当这些模型被问及代码是否恶意时,它们不仅是在回答一个编程问题,更是在用处理是非对错的机制来权衡它。

同日更多故事

2026-10-06