Robo de cadenas de razonamiento cifradas de APIs de LLM propietarios

Stealing Reasoning Traces from Proprietary LLM APIs

Robo de cadenas de razonamiento cifradas de APIs de LLM propietarios

Investigadores demuestran que los bloques de razonamiento cifrados devueltos por APIs de Anthropic, OpenAI y Google son portátiles y pueden reproducirse en modelos más débiles y jailbroken del mismo proveedor, permitiendo extraer el razonamiento oculto del modelo fuerte en texto plano sin atacar directamente al modelo fuerte ni activar sus salvaguardas antidestilación. El ataque se realiza en dos llamadas a la API y funciona en modelos como Claude, GPT y Gemini.

El razonamiento propietario puede recuperarse de sus trazas cifradas.

Más de este día

2026-08-11