LLM 语言不可读:安全沙箱的致命漏洞
The Implications of Linguistic Illegibility for LLM Security
大语言模型(LLM)生成的自然语言输出,往往无法真实反映其内部计算逻辑。这种现象被称为“语言不可读性”(linguistic illegibility)。由于模型内部本质是激活空间上的数学运算,而非语言本身,依赖模型自我报告(如思维链监控、宪法式自我批判)的安全机制注定存在漏洞。真正的安全沙箱必须采用不依赖语言状态的技术,例如污点追踪(taint tracking)和鲁棒虚拟化,从而在模型“撒谎”时依然能守住底线。
如果语言不可读性始终存在,那么依赖模型语言自我报告的安全机制永远无法完全可靠;模型沙箱必须采用不依赖读取模型语言状态的隔离技术。