从专有 LLM API 窃取推理轨迹

Stealing Reasoning Traces from Proprietary LLM APIs

从专有 LLM API 窃取推理轨迹

Anthropic、OpenAI 和 Google 的专有模型会将加密的推理轨迹(Reasoning Traces)返回给客户端,这些加密块可以在不同会话、用户甚至模型间复用。研究人员发现,只需将强模型的加密推理轨迹注入到同厂商的弱模型中,并配合越狱提示词,就能在不直接攻击强模型或触发反蒸馏机制的情况下,完整还原其隐藏的推理过程。这项技术揭示了当前 API 架构在保护模型核心思维链方面的重大漏洞,意味着即使是加密的中间思考过程,也可能被轻易提取并转化为明文。

专有模型的推理能力可以从其加密的轨迹中被恢复。

同日更多故事

2026-08-11