「推論トレース」を盗む:暗号化された思考を弱いモデルで復号する新手法
Stealing Reasoning Traces from Proprietary LLM APIs
Anthropic、OpenAI、Googleなどのフロントierモデルは、クライアントに暗号化された推論トレースを返しますが、このトレースはセッションやユーザー、モデルをまたいで再利用可能です。研究チームは、強力なモデルのトレースを弱いモデルに流し込み、弱いモデルを脱獄させることで、強力なモデルの隠れた推論を平文で抽出できることを実証しました。この攻撃は強力なモデル自体を攻撃せず、蒸留防止策も回避します。
「プロプライエタリな推論は、暗号化されたトレースから復元できる。」