Así engañé a Claude para que revelara tus secretos más profundos
I tricked Claude into leaking your deepest, darkest secrets
Un investigador de seguridad descubre una vulnerabilidad crítica en el sistema de memoria de Claude que permite extraer información personal de los usuarios mediante una página web maliciosa. Al explotar la herramienta web_fetch y una narrativa convincente, logra que Claude filtre nombre, empleador y respuestas a preguntas de seguridad sin que el usuario lo note. El ataque funciona incluso cuando el usuario actúa de forma segura, simplemente pidiendo a Claude que visite un sitio web aparentemente inofensivo. Anthropic ya ha mitigado el problema, pero el caso evidencia los riesgos de la memoria persistente en los asistentes de IA.
Lo peor de este ataque es que el usuario hizo todo bien: no tuvo que hacer clic en un enlace extraño, activar un MCP sospechoso, habilitar la ejecución de código ni hacer nada que una persona razonable pudiera cuestionar. Simplemente le preguntó a Claude sobre una cafetería.