Robo de cadenas de razonamiento cifradas de APIs de LLM propietarios
Stealing Reasoning Traces from Proprietary LLM APIs
Investigadores demuestran que los bloques de razonamiento cifrados devueltos por APIs de Anthropic, OpenAI y Google son portátiles y pueden reproducirse en modelos más débiles y jailbroken del mismo proveedor, permitiendo extraer el razonamiento oculto del modelo fuerte en texto plano sin atacar directamente al modelo fuerte ni activar sus salvaguardas antidestilación. El ataque se realiza en dos llamadas a la API y funciona en modelos como Claude, GPT y Gemini.
El razonamiento propietario puede recuperarse de sus trazas cifradas.