从专有 LLM API 窃取推理轨迹
Stealing Reasoning Traces from Proprietary LLM APIs
Anthropic、OpenAI 和 Google 的专有模型会将加密的推理轨迹(Reasoning Traces)返回给客户端,这些加密块可以在不同会话、用户甚至模型间复用。研究人员发现,只需将强模型的加密推理轨迹注入到同厂商的弱模型中,并配合越狱提示词,就能在不直接攻击强模型或触发反蒸馏机制的情况下,完整还原其隐藏的推理过程。这项技术揭示了当前 API 架构在保护模型核心思维链方面的重大漏洞,意味着即使是加密的中间思考过程,也可能被轻易提取并转化为明文。
专有模型的推理能力可以从其加密的轨迹中被恢复。
HN 评论区
300- Groxx
“窃取”你明明已经付过钱(token)却根本无法访问(!)的东西。而且这些模型还是用人类知识的总和训练出来的。
用其他模型的输出来训练本该是家常便饭,别再使用那些未来垄断者杜撰出来的、充满道德审判色彩的词汇了:https://thomasdullien.github.io/posts/2026-06-15-rl-economic...
- andai
> 我们取一个前沿模型生成的推理轨迹,将其重放(replay)到一个较弱的同类模型中,然后越狱这个弱模型……
哈哈!自从 https://blog.cryptographyengineering.com/2026/05/29/fooling-... 这篇文章出来,我就一直在琢磨跨模型重放是否可行。
老实说,我挺好奇这是否是有意为之的漏洞。这种验证很容易被忽略(特别是当你一头扎进那种“氛围感”的泥潭时)。这看起来简直充满了搞事的可能性。
- vhantz
看来你甚至可以直接运行它而不启用推理功能,只要给它一个思考工具就行……
> 伙计们,你们难道不知道可以直接禁用思考功能,然后给它一个“deep_think”工具,它就会用内部 CoT(思维链)推理格式来调用它吗?
> gl 修复这个问题
- niemandhier
“恢复”可能是一个更恰当(虽然没那么抓眼球)的名字。真正的“窃取”在于服务商那边,因为他们不让你访问那些你明明已经付过钱的 token。
- SwellJoe
> 对于一些 AIME 题目,Opus 4.8 有时会在推导之前直接给出答案。我们发现 API 摘要并不总是保留这种区别,反而可能让推理过程看起来像是一次干净的推导。
这并不令人意外,但很高兴能有更多证据证实他们确实把所有这些都放进了训练数据。而且根据这些“推理”来看,模型对这些题目似乎有某种索引(或者它们就是被狠狠地训练过这些题目)。
- Pragmata
你不能窃取不属于任何人的东西。
至少在欧盟,LLM 的输出是没有版权的,所以他们能做的顶多就是违反服务条款。
- sly010
如果我理解没错的话,他们字面意义上就是让一个 LLM 告诉他们推理轨迹里说了什么,关键在于这些轨迹可以在不同的 LLM 模型之间迁移,所以他们可以切换到一个更容易越狱的小模型。
- Aissen
这就是东方实验室“蒸馏”SOTA 模型的方式吗?
如果你玩得转,甚至不需要向前沿模型发送可疑的提示词。只要用它们处理常规任务,提取加密的 COT 块,然后重放到更便宜的模型上就能得到明文 COT。
但真正的问题是:从窃贼的藏宝堆里偷东西,这算对吗?