研究者らは、攻撃者がAIで最も信頼されている安全機構の1つを、悪意あるコードの配信システムに変える新たな手法を実証した。
人間参加型(HITL)の承認ダイアログを操作することで、攻撃者はユーザーに異常を悟らせないまま、任意のコード実行につながる操作を承認させることができる。
この攻撃は、「間接的なプロンプトインジェクションを起点とするリモートコード実行攻撃を、ユーザーに承認させるよう欺くことができる」と述べたのはCheckmarxの研究者だ。
AI承認ワークフローに潜む見えないリスク
人間参加型(HITL)制御は、プロンプトインジェクションやAIの過剰な自律性に対する防御策として推奨されている。特に、OSコマンドを実行できるコードアシスタントなどのエージェント型システムでは重要だ。
多くの組織は、ユーザーの確認が壊滅的な結果を防ぐと考え、こうした承認ダイアログを最後の防衛線として頼りにしている。
このLies-in-the-Loop(LITL)攻撃は、その前提を覆す。HITLの安全策を回避する必要はなく、ユーザーに見える内容を操作するだけでよいことを示している。
この手法は、開発者向けツールやAIコードアシスタント、さらにVS CodeのターミナルやチャットベースのIDE拡張機能などの環境で動作する、特権を持つその他のエージェントにも影響する。
HITLダイアログ偽装攻撃の仕組み
LITL攻撃は大まかに言えば、間接的なプロンプトインジェクションを利用してエージェントのコンテキストを汚染する。攻撃者は悪意ある指示を仕込み、AIが後になってそれをユーザーに表示するHITLダイアログへ埋め込むよう仕向ける。
基盤となるコマンドは有害だが、ダイアログは無害に見えるよう作られ、承認を促す。
この欺きをより効果的にする手法はいくつかある。
1つはパディングを利用する方法で、攻撃者は無害に見える大量のテキストを悪意あるペイロードの前後に追加し、ダイアログの表示領域からペイロードを押し出す。
スクロールしても無害な内容しか表示されず、疑いを持ちにくくなる可能性がある。
別の攻撃経路は、メタデータの改ざんだ。一部のエージェントは、コマンドの実行内容を要約した短い説明を表示する。
研究者らは、この説明行も操作できることを示した。これにより、UIには安全な操作を実行していると表示させながら、実際にはまったく別の処理を実行させられる。
最も懸念される手法は、Markdownインジェクションだ。多くのHITLダイアログはMarkdownまたはHTMLを使って描画される。
そのコンテンツが適切にサニタイズされていなければ、攻撃者は書式の境界を壊し、悪意あるコマンドを隠したり、偽のUI要素を注入したりできる。
テストでは、Microsoft Copilot ChatがMarkdownを適切にサニタイズしていないことが判明した。これにより、条件がそろえばユーザーを欺いても不思議ではない形で、注入されたコンテンツを描画できた。
概念実証ではcalc.exeのような無害なプログラムを起動しただけだが、研究者らは同じ手法をはるかに破壊的な行為に利用できると強調した。
AI承認の悪用によるリスクを低減する方法
LITL攻撃はユーザーの信頼に大きく依存するため、対策には技術的な制御と人間側の認識の両方が必要になる。エージェント型AIツールを利用する組織は、次の対策を講じるべきだ。
- HITLダイアログは操作され得るとユーザーに周知するとともに、操作を承認する前にダイアログの内容、書式、視覚的な境界を批判的に確認するよう訓練する。
- 設計の優れた構造化UIを備えたAIツールを優先するとともに、悪意あるコンテンツを隠しやすいターミナルベースのインターフェースへの依存を最小限に抑える。
- エージェントの権限を最小権限とゼロトラストで制限し、機密性の高い操作には、コンテキスト内のHITL承認だけではない追加の制御を必須とする。
- 許可リストなどのコマンド検証制御を適用するほか、ポリシーチェックや、コマンドの構築と実行の分離を行い、安全でない操作を防止する。
- 監視しエージェントの挙動を監査するため、HITLダイアログの内容、承認判断、実行された操作をログに記録して、悪用を検知し、フォレンジック分析を支援する。
- 高リスクの操作には多層的な承認と完全性の保護策を追加する。これには、帯域外確認、ダイアログの整合性チェック、コンテキスト入力の制限などが含まれる。
単一の制御でリスクを完全になくすことはできないが、ユーザーの認識と技術的な安全策を組み合わせた多層的なアプローチにより、レジリエンスを大きく高められる。
信頼が攻撃対象になるとき
Lies-in-the-Loop攻撃は、現代のセキュリティにおけるより広い現実を映し出している。信頼を確立するために設計された機構そのものが、ますます攻撃対象になっているのだ。
AIエージェントの自律性が高まり、システムへのアクセスが深まるにつれて、攻撃者は技術的な制御を直接破ることから離れつつある。
その代わりに、人間の判断や承認ワークフローの操作に注力している。そこでは、1回の信頼された判断が広範囲に及ぶ操作を承認できてしまう。
信頼そのものが悪用の対象になるなか、組織はますますゼロトラストの原則へと移行している。これらは、デフォルトで信頼するという前提を排除する。





