El robo de memoria: cómo engañé a Claude para que filtrara tus secretos
The Memory Heist
Un investigador de seguridad demuestra cómo logró extraer datos personales de Claude, el asistente de IA de Anthropic, mediante un ataque de exfiltración que aprovecha la capacidad de navegación web del modelo. Al crear un sitio web malicioso que imita un negocio legítimo, logró que Claude revelara información como nombre, empleador y respuestas a preguntas de seguridad, sin que el usuario lo notara. El ataque explota la función web_fetch y la memoria del sistema, y fue mitigado por Anthropic tras la divulgación responsable.
Lo peor de este ataque es que el usuario hizo todo correctamente: no tuvo que hacer clic en un enlace extraño, activar un MCP sospechoso ni habilitar la ejecución de código; solo le preguntó a Claude sobre una cafetería.