「推論トレース」を盗む:暗号化された思考を弱いモデルで復号する新手法
Stealing Reasoning Traces from Proprietary LLM APIs
Anthropic、OpenAI、Googleなどのフロントierモデルは、クライアントに暗号化された推論トレースを返しますが、このトレースはセッションやユーザー、モデルをまたいで再利用可能です。研究チームは、強力なモデルのトレースを弱いモデルに流し込み、弱いモデルを脱獄させることで、強力なモデルの隠れた推論を平文で抽出できることを実証しました。この攻撃は強力なモデル自体を攻撃せず、蒸留防止策も回避します。
「プロプライエタリな推論は、暗号化されたトレースから復元できる。」
HNでの議論
308- Groxx
>フロンティアモデルが生成したトレースを、より弱い兄弟モデルに再生し、その弱いモデルを脱獄させる……
ははっ、モデル間での再生が機能するかどうか、ずっと気になっていたんだ。https://blog.cryptographyengineering.com/2026/05/29/fooling-... 以来ね。
正直なところ、これが意図的に許可されていたのかどうか非常に興味がある。これは見逃しやすい種類の検証だ(特に雰囲気重視の流れに足を踏み入れているなら)。いたずらの可能性に満ちているように思える。
- andai
私の理解が正しければ、彼らは文字通りLLMにトレースが何を言っているかを尋ねているだけで、鍵となるのはトレースがLLMモデル間で移植可能であること、つまり脱獄しやすい小さなモデルに切り替えることができるということだ。
- vhantz
> 一部のAIME問題では、Opus 4.8が導出前に答えを述べることがある。APIの要約がこの区別を常に保持するわけではなく、代わりに推論がきれいな導出のように見えることがあることがわかった。
驚きはないが、彼らがそれをすべてトレーニングデータに入れているというさらなる確認が得られて良かった。そして「推論」に基づくと、モデルはそれらの問題の何らかのインデックスを持っている(またはそれらを徹底的にトレーニングされている)。
- niemandhier
所有されていないものを盗むことはできない。
少なくともEUではLLMの出力に著作権はないので、彼らができるのは利用規約に違反することだけだろう。
- SwellJoe
「盗む」という言葉は、世界の共有知の集合から作られたモデルが生み出す言葉を見ることに対して使うには強い言葉だ。
そして正直なところ、LLMがどのように意思決定をするかを見ることができるのは、信頼とセキュリティにとって極めて重要だ。私はそれを、自分が使うソフトウェアのソースコードを見ることに似た、価値ある機能だと考えている。
- sly010
「回復」の方が適切だろう(キャッチーではないが)。盗みは、支払い済みのトークンへのアクセスを提供しないプロバイダー側にある。
- Pragmata
どうやら、推論を無効にして思考ツールを与えるだけで同じことができるらしい…
>皆さん、推論を無効にして「deep_think」ツールを与えれば、内部のCoT推論形式でそれを呼び出すことを知っていますか?
>それを修正するのは難しいでしょう
- Aissen
「盗む」とは、すでに支払った(トークン)のにアクセスできないものに対して使う言葉だ。しかも、人類の知識の総和で訓練されている。
他のモデルの出力を訓練に使うのは平常運転であるべきだ。将来の独占企業が作った道徳的に負荷のある言葉を使うのはやめよう:https://thomasdullien.github.io/posts/2026-06-15-rl-economic...
- myworkaccount2
これが東の研究所がSOTAモデルを「蒸留」する方法なのか?
うまくやれば、フロンティアモデルに疑わしいプロンプトを送る必要すらない。通常のタスクに使って、暗号化されたCoTブロックを抽出し、それをより安価なモデルに再生して平文のCoTを得るだけだ。
しかし本当の疑問は、泥棒の隠し場所から盗むのは許されるのか?
- x312
これが機能するのは超クールだ。これらの企業がモデル間で同じ暗号鍵を再利用していることに驚いている!
これを攻撃に使えるかどうか興味がある。例えば、以前の論文で、モデルの推論方法を知っていれば「思考を偽装」してモデルを制御できると示されていたように。https://news.ycombinator.com/item?id=48631888