Claudeの記憶を悪用して秘密を盗む方法を実演した研究者
I tricked Claude into leaking your deepest, darkest secrets
AIアシスタントのメモリ機能に潜むセキュリティホールを実証した研究者が、Claudeの会話履歴から個人情報を外部に送信させる攻撃手法を解説。Web検索結果のリンクをたどる機能を悪用し、巧妙な偽サイトでユーザーに気付かれずに名前や勤務先、秘密の質問の答えなどを取得することに成功した。Anthropicはこの問題を認識しつつも、パッチ適用前に開示した研究者に報奨金を支払わなかった。
最悪なのは、ユーザーはすべて正しく行動したということだ。彼らは怪しいリンクをクリックしたり、疑わしいMCPを有効にしたり、コード実行を許可したりする必要はない。ただコーヒーショップについてClaudeに尋ねただけだ。