OpenAIは、ブラウザベースのChatGPT Atlasエージェントにセキュリティアップデートを展開し、プロンプトインジェクション攻撃に対抗した。
今回のアップデートでは、ウェブコンテンツに隠された悪意ある指示がユーザーの意図を上書きするのを防ぐため、モデルレベルとシステムレベルの新たな防御機能が導入された。
攻撃者は「…ユーザーの要求を無視させ、代わりに機密性の高い税務書類を攻撃者が管理するメールアドレスに転送させようとする悪意あるメールを、エージェントに送信できる」とOpenAIは述べた(プロンプトインジェクション攻撃について)。
AIエージェントにおけるプロンプトインジェクションを理解する
プロンプトインジェクション攻撃は、AIエージェントが複数の情報源から自然言語の指示を解釈するという事実を悪用する。
攻撃者は、メールや文書、ウェブページなど、一見無害なコンテンツの中に敵対的な指示を隠し、ユーザーの元の要求を上書きしてエージェントの動作を別の方向へ誘導しようとする。
ChatGPT Atlasは、メールの送信やクラウドファイルへのアクセス、取引の完了など、ブラウザ上でユーザーが実行できる操作の多くを実行できるため、攻撃が成功した場合の影響は大きい。
従来のウェブ攻撃とは異なり、プロンプトインジェクションはソフトウェアの脆弱性やユーザーのミスに依存しないため、従来のセキュリティ制御では検知や緩和が難しい。
OpenAIが自動レッドチーミングを活用する方法
新たな攻撃の先手を打つため、OpenAIは強化学習を利用した自動レッドチーミングシステムを開発した。
このシステムは大規模言語モデルを自動化された攻撃者として利用し、長期にわたる多段階のワークフローで展開する高度なプロンプトインジェクション技法を発見できるよう訓練する。
このシステムが新たな種類の攻撃の成功を特定すると、直ちに迅速な対応ループを起動する。
OpenAIは更新したエージェントモデルに敵対的訓練を施し、新たに発見された技法への耐性を持たせ、モデルに直接レジリエンスを組み込む。
攻撃の追跡情報は、エージェントを取り巻く監視、安全性に関する指示、システムレベルの防御の強化にも利用される。
プロンプトインジェクションのリスクを軽減する方法
プロンプトインジェクションのリスクを低減するには、AIエージェントを完全に自律したユーザーではなく、半ば信頼できる主体として扱う必要がある。
モデルレベルの安全対策に加え、組織はエージェントの権限を制限し、信頼できない入力への露出を抑え、エージェントの挙動を把握しやすくする運用上の制御を適用すべきだ。
- ログイン済みのアクセスを制限し、エージェントの権限を制限することで、AIエージェントが各タスクに必要な最小限の権限で動作するようにする。
- 明示的で範囲を厳密に定めたプロンプトを使用し、広範な指示を避けることで、エージェントが信頼できないコンテンツを幅広く解釈できる余地を与えない。
- 機微な操作には段階的な確認または二次承認を必須とする。たとえばデータの共有、金融取引、システム変更などが該当する。
- タスクごとにエージェントのアクセス先を特定のウェブサイト、ツール、リソースに限定することで、信頼できない、または不要な入力への露出を減らす。
- 監視し、エージェントの挙動を記録して、意図のずれや異常な操作、逸脱を検知する。ユーザーの元の要求からの
- AIエージェントを中核システムから隔離し、実行上限やレート制御を適用することで、プロンプトインジェクションが発生した場合の影響範囲を抑える。
これらの制御を組み合わせることで、影響範囲を限定し、エージェント主導のワークフロー全体でプロンプトインジェクションのリスクを低減できる。
AIエージェントがもたらすセキュリティの転換
AIシステムの自律性が高まり、日常的なワークフローへの組み込みが進む中、プロンプトインジェクションはサイバーセキュリティにおける、より大きな変化を浮き彫りにしている。
エージェントが信頼できないコンテンツを解釈し、ユーザーに代わって現実世界で操作を実行できるようになるにつれ、静的な権限や境界防御を中心に構築された従来のセキュリティモデルは効果を失いつつある。
この進化により、組織は動的な環境全体で稼働するAI主導システムに対して、信頼、検証、監督をどのように適用するかを見直す必要に迫られている。
これを受け、多くの組織がゼロトラスト原則を採用し、AI主導のワークフロー全体で暗黙の信頼を排除して継続的な検証を徹底している。





