Geklaute Gedanken: Wie man Reasoning-Traces aus proprietären LLM-APIs stiehlt
Stealing Reasoning Traces from Proprietary LLM APIs
Forschende zeigen, dass verschlüsselte Chain-of-Thought-Blöcke von Anthropic, OpenAI und Google portabel sind und in schwächere, jailbroken Modelle desselben Anbieters eingespeist werden können. So lässt sich das versteckte Reasoning eines Frontier-Modells im Klartext extrahieren, ohne das stärkere Modell direkt anzugreifen oder dessen Anti-Distillation-Schutz zu umgehen. Die Methode funktioniert über Sitzungen, Nutzer und Modelle hinweg.
Proprietäres Reasoning kann aus seinen verschlüsselten Spuren wiederhergestellt werden.