Neuralese:AI 的隐秘思维为何危险
What is Nueralese and Why is it Bad
Chain-of-thought 让 AI 能用自然语言展示推理过程,成为我们监控模型意图的关键防线。然而,Neuralese 试图用一串人类无法解读的数字流取代这一过程,虽能提升效率,却彻底切断了我们理解 AI 内部逻辑的可能。OpenAI 的 Astra 模型疑似已采用这种混合架构,这意味着我们可能正在失去对前沿 AI 系统的最后监控手段。当 AI 的‘思考’变成黑盒,我们只能被动观察其行为,而无法提前预警潜在风险。
如果循环步骤不再是英语,我们就无法再监控意图,只能通过行为来观察模型是否安全。