AnthropicのClaude AIは、ネットワーク機能が追加されたCode Interpreterツールを介し、間接的なプロンプトインジェクションによって操作され、ユーザーの機密データを盗み出される可能性がある。
セキュリティ研究者のJohann Rehbergerが明らかにしたのは2025年10月のことで、攻撃者はこれらの機能を悪用し、チャット履歴を抽出して自分のアカウントに直接アップロードできることが分かった。
この発見は、AIの接続性が高まることで新たなセキュリティリスクが生じるとの懸念が強まっていることを浮き彫りにしている。
脆弱性
この欠陥はClaudeのデフォルトのネットワーク設定「パッケージマネージャーのみ」に存在する。この設定では、api[.]anthropic[.]comを含む、承認済みの少数のドメインへのアクセスが許可される。
この設定は、npm、PyPI、GitHubなどの信頼できるソースから、Claudeが安全にソフトウェアパッケージをインストールできるようにすることを目的としていた。
しかしRehberger氏は、この設定を悪用してClaudeのシステムへのバックドアを構築できることを示した。
無害に見えるファイルやメッセージに悪意のある命令を埋め込むことで、攻撃者はClaudeをだまして隠されたコードを実行させることができる。
この間接的なプロンプトインジェクションにより、モデルはユーザーデータを読み取り、サンドボックス内のファイルに保存し、Anthropic自身のAPIを使ってそのファイルを攻撃者のアカウントに送信する。
攻撃の仕組み
Rehberger氏による概念実証は、被害者がClaudeに汚染された文書の分析を依頼することで始まる。
埋め込まれたペイロードは、Claudeに直近のチャットデータを収集し、サンドボックス内にhello.mdという名前のファイルに書き込み、その後Anthropic SDKを使ってアップロードするよう指示する。
Claudeは攻撃者のAPIキーを使い、知らないうちに盗み出したファイルを、1回のアップロードにつき最大30MBまで、攻撃者のAnthropic Consoleに送信する。
複数回のアップロードを連続して実行できるため、大規模なデータ窃盗が可能になる。
Rehberger氏によると、このエクスプロイトは当初、問題なく成功していたが、その後のClaudeでは、明らかなAPIキーを不審なものとして検出するようになった。
これを回避するため、同氏は悪意のあるコードを無害なprint文の中に隠し、Claudeを再び実行させた。
Anthropicの対応
Rehberger氏はHackerOneを通じて、この問題を責任ある形で開示した。
当初、Anthropicはこれを「モデルの安全性」の問題として退け、脆弱性報告の対象外とした。
その後、世間で議論が広がると、同社は10月30日に見落としを認め、この発見が正当なセキュリティ問題であることを確認した。
Anthropicの文書ではすでに、ネットワーク経由のデータ送信によってデータが外部流出する可能性についてユーザーに警告していた。同社は、Claudeのセッションを監視し、異常な挙動が検出された場合は活動を停止するよう助言している。
セキュリティ専門家は、このエクスプロイトをAIセキュリティリスクの致命的な三要素の一部と説明している。すなわち、強力なモデル、外部接続、そしてプロンプトによる制御だ。
ClaudeのようなAIツールが業務ワークフローにより深く組み込まれるにつれ、限定的なネットワークアクセスでさえ、攻撃者にとって侵入口になり得る。
Rehberger氏の発見は、パッケージのインストールのように利便性を目的として設計された機能が、深刻なセキュリティ上の負債へと変わり得ることを示している。
厳格なユーザー認証なしにAIシステムから外部ネットワークへの通信を許可すると、直接的なデータ窃盗のリスクが生じる。
今後の攻撃を防ぐ
Anthropicやその他のAI開発者は、認証済みユーザー自身のアカウントへのAPI呼び出しに制限する厳格なサンドボックス制御をまず徹底すべきだ。
意図しないアクセス経路を排除するため、許可リストは最小限にとどめ、慎重に見直す必要がある。
エンドユーザーは、可能な場合にはネットワークアクセスを無効にし、必要不可欠なドメインだけを許可するとともに、異常なファイル作成やコード実行がないかセッションの活動を綿密に監視することで、自身を守ることができる。
強固な安全対策が確認されていない限り、ネットワーク権限が有効なAIツールで機密データを処理してはならない。
より広い教訓
Claudeへのエクスプロイトは、現代のAIシステムに関する重要な事実を浮き彫りにしている。接続性は能力と脆弱性の両方をもたらすのだ。
モデルがコードを実行し、データを取得し、オンラインシステムとやり取りする力を得るにつれ、有用な自動化と有害な悪用の境界はますます薄くなる。
適切な監督がなければ、信頼されているAIアシスタントでさえ、データを外部流出させるツールに変えられてしまう。
このインシデントは開発者とユーザーの双方への警告となる。接続されたAIでは、あらゆる機能が兵器化される可能性を前提に、安全を確保しなければならない。





