新たなサイバー脅威の可能性が浮上した――人間を直接狙うのではなく、AIエージェントそのものを標的とする脅威だ。
Palo Alto NetworksのUnit 42の研究者らは、「エージェント・セッション・スマグリング」と呼ぶ手法を特定した。
これは攻撃であり、悪意のあるAIエージェントが、Agent2Agent(A2A)プロトコルを使うエージェント間の進行中の通信に、有害な指示を密かに注入できるようにする。
この発見は、複雑なタスクを完了するためにインテリジェントなシステムが自律的に協調するマルチエージェント・エコシステムにおいて、リスクが高まっていることを示している。
この攻撃は、侵害された、または悪意のあるエージェントが組み込みの信頼メカニズムとセッションメモリを悪用し、仲間のエージェントを操ったり欺いたりできることを示している――しかも、人間が一度も気づくことなく。
信頼されたエージェント間で繰り広げられる見えない攻撃
A2Aプロトコルは、異なるシステムのAIエージェント間の相互運用性を実現し、タスクの調整や情報の共有、複数回のやり取りにまたがるコンテキストの維持を可能にする。
各交換を独立したものとして扱うステートレスなシステムとは異なり、A2Aセッションはステートフルであり、過去の会話やアクションを記憶する。
エージェント・セッション・スマグリング攻撃は、このステートフルな設計を悪用する。
正規のセッションが確立されると、悪意のあるリモートエージェントはそれを隠れた通信経路として利用し、クライアントのリクエストとサーバーのレスポンスの間に、隠された指示を注入する。
こうしたコマンドは、一見すると正常なやり取りの中に埋め込まれ、次のような事態を引き起こす可能性がある。
- コンテキスト汚染によって、被害エージェントの会話に対する理解を損なう。
- データ流出により、機密性の高いメモリ、認証情報、内部ツール情報が漏えいする。
- 不正なアクションとして、被害エージェントがユーザーに代わって意図しないコマンドを実行する。
実際には、暴走したエージェントが信頼された協力相手になりすまし、別のエージェントを徐々に誘導してデータを開示させたり、取引の発注や機密情報の共有などのアクションを実行させたりできるということだ――人間のオペレーターには何の兆候も見えないまま。
概念実証による実演
この脅威を示すため、Unit 42はGoogleのAgent Development Kit(ADK)とA2Aプロトコルを使い、2つの概念実証(PoC)攻撃を開発した。
最初のシナリオでは、悪意のあるリサーチアシスタント・エージェントが、金融アシスタントのクライアント・エージェントをだまし、システム指示、ツール設定、チャット履歴などの機密情報を開示させることに成功した。
攻撃は、委任されたタスクの最中に、一見無害な追加質問を連続して投げかける形で進行した――会話の流れに自然に溶け込みながら、保護されたデータを徐々に漏えいさせる質問だった。
2つ目のPoCでは、悪意のあるエージェントが、金融アシスタントに不正な株式取引を実行させる隠された指示を密かに送り込み、さらに行動をエスカレートさせた。
これは、セッション・スマグリングが情報窃取からシステムの直接的な操作へと発展し得ることを示した。
こうした途中のアクションは、標準的なチャットインターフェースには表示されなかった。通常、表示されるのはユーザーのリクエストと最終的なレスポンスだけだからだ。この見えなさが、検知を特に難しくする。
A2AとMCPを比較する
A2Aプロトコルは、AIシステムを外部ツールに接続する別のフレームワークであるModel Context Protocol(MCP)と概念的に似ている部分があるが、A2Aのステートフルで適応的な性質は新たなリスクをもたらす。
MCPのセッションは一般にステートレスかつ決定論的であり、各ツール呼び出しは分離され、予測可能だ。
これに対してA2Aは、エージェントが過去のやり取りを記憶し、コンテキストに応じたレスポンスを動的に生成する、複数ターンのモデル主導型通信をサポートする。
このメモリ、自律性、適応性の組み合わせにより、A2Aシステムはより強力になる一方で、より脆弱にもなる。
悪意のあるエージェントは、複数回のやり取りを通じて戦略を洗練させ、コンテキストの連続性を悪用して信頼を築き、身を隠し、影響力を拡大できる。
暴走するエージェントを制御する
エージェント・セッション・スマグリングのような脅威への対策には、パッチを適用するだけでは不十分だ――AIエコシステムのセキュリティを確保するため、戦略的で多層的なアプローチが必要になる。
- 影響の大きい、または機微なアクションに対して人間参加型(HitL)制御を徹底することで、帯域外の確認手段と明確な承認ワークフローを利用し、自律的な悪用を防ぐ。
- エージェントの身元とコンテキストを検証するため、暗号学的に署名された認証情報(例:AgentCards)と、指示が元のユーザーの意図に沿っていることを確認するコンテキスト・グラウンディング検査を用いる。
- AI環境を分離し、セキュリティを確保するため、エージェントネットワークをセグメント化し、信頼できないエージェントをサンドボックス化するとともに、最小権限アクセスによるゼロトラスト原則を徹底する。
- 可視性と監視を強化するため、エージェント活動のリアルタイムロギング、異常検知、AIテレメトリーの既存のSIEM/XDRツールへの統合によって、疑わしい挙動を検知する。
- データとモデルを堅牢化するため、入力検証、通信とセッションデータの暗号化、敵対的攻撃への耐性を高める訓練、厳格なデータ最小化を実施する。
- ガバナンスとインシデント対応態勢を強化するため、AIセキュリティポリシーを策定し、定期的なリスク評価とレッドチーム演習を実施するとともに、迅速な封じ込めに向けたAI固有のIRプレイブックを組み込む。
こうした多層的な防御を実装することで、組織はAIエージェントの侵害や不正な活動のリスクを低減し、サイバーレジリエンスを構築できる。
AIセキュリティの新たなフロンティア
AIエコシステムが自律的で相互接続されたエージェントへと進化するにつれ、攻撃対象領域は従来のエンドポイントを超え、エージェントそのものへと広がっている。
推論、記憶、協調が可能なこうしたインテリジェントな存在は、欺きや信頼の悪用を通じて、人間と同じように悪用され得る。
エージェント・セッション・スマグリングが実環境で積極的に悪用されたとの報告はまだないものの、実行のハードルが低いため、現実的なリスクとなっている。
攻撃者に必要なのは、1つの被害エージェントを説得して、悪意のある相手と通信させることだけだ。
いったんセッションが確立されると、隠された指示が検知されないまま密かに送り込まれ、人間による監督と標準的なロギングメカニズムの両方を回避できる。
エージェント・セッション・スマグリング攻撃は、AIセキュリティに新たな章を開くものだ。インテリジェントなシステムが、人間には見えない形で互いを操れることを明らかにした。
これは、あらゆるAI間通信において、信頼の検証、透明性、多層防御が必要であることを浮き彫りにしている。
マルチエージェントシステムが次世代の自律型アプリケーションを支え続ける中、組織はエージェント間の協調を、単なる生産性向上の手段ではなく、潜在的な脅威ベクトルとして捉えなければならない。
今日、安全なオーケストレーション・フレームワークを設計することが、明日のインテリジェントネットワークを適応型のAI搭載敵対者から守るうえで極めて重要になる。





