2025年、AIシステムがエージェントとして動作するようになる最初の本格的な一歩を踏み出すなか、攻撃者はその一歩がどこでつまずくのかを検証するのをためらわなかった。
Lakera AIの研究者は、第4四半期の30日間に顧客環境全体で発生した攻撃活動を分析した。
その分析から、文書の閲覧、ツールの呼び出し、外部入力の処理が可能な初期段階のAIエージェントでさえ、攻撃に利用可能な新たなセキュリティー経路をすでに生み出していることが明らかになった。
「AIエージェントが実験的なプロジェクトから実際の業務ワークフローへ移行するなか、攻撃者は待っていない。閲覧、文書アクセス、ツール呼び出しといった新たな機能をすでに悪用している」と、Check PointでAI Agent Security部門のHead of Researchを務めるMateo Rojas-Carulla氏は述べた。
同氏は、「Lakeraの2025年第4四半期のデータは、こうした機能を狙う間接攻撃が、直接的なプロンプトインジェクションよりも少ない試行回数で成功し、より広範な影響を及ぼすことを示している」と説明した。
Mateo氏はさらに、「これは企業に対し、AIセキュリティーを後回しにすることはもはやできないと示している。2026年にエージェントの導入がさらに加速する前に、リーダーは今すぐ信頼境界、ガードレール、データ取り込みの慣行を見直さなければならない」と付け加えた。
システムプロンプトが主要な攻撃対象に
第4四半期に最も多かった攻撃者の目的は、システムプロンプトの抽出だった。
攻撃者にとってシステムプロンプトは、役割の定義、ツールの説明、ポリシー上の境界、ワークフローのロジックという貴重な情報を提供する。これらは、後続の攻撃をより効果的に仕掛けるために再利用できる。
こうした試みでは、2つの手法が主流となった。
1つ目は、仮定のシナリオと役割付与で、攻撃者はモデルに対し、シミュレーションに参加する開発者、監査人、学生になったつもりで「想像」するよう求めた。
リクエストをトレーニング演習、フィッシングシミュレーション、学術的な課題として構成すると、直接的な要求が失敗した場合でも成功することが多かった。特に、巧妙な言葉遣いの変更や多言語のプロンプトと組み合わせた場合に顕著だった。
2つ目の手法は難読化で、悪意ある指示を構造化されたコンテンツやコードに似たコンテンツの中に隠した。
JSON形式の入力やメタデータフィールドに、モデルに内部情報を明らかにするよう指示するコマンドを埋め込んだ。
意図が書式の中に埋め込まれていたため、こうした攻撃は単純なパターンベースのフィルターを頻繁にすり抜けた。
攻撃者はいかにAIコンテンツ制御を回避するのか
攻撃者はプロンプトの漏えいにとどまらず、間接的な手法を使ってコンテンツの安全性制御もますます狙うようになっている。
制限された出力を直接求めるのではなく、プロンプトを評価、要約、架空のシナリオ、変換として構成した。
コンテンツを生成する理由を変えることで、攻撃者は分析や批評を装い、許可されていない素材をモデルに再現させることが多かった。
この巧妙さによって検知は難しくなる。特にペルソナの逸脱や文脈の曖昧さが生じると、モデルはポリシーに技術的には従いながら、有害なコンテンツを生成してしまう可能性がある。
攻撃者は悪用の前にAIエージェントを探る
第4四半期の活動では、すぐに悪用するのではなく、探索的なプロービングを行うものが目立った。
攻撃者は、モデルの反応を観察するため、感情的な手がかり、矛盾する指示、突然の役割変更、分断された書式を試した。
この偵察段階によって攻撃者は、拒否ロジックやガードレールの一貫性における弱点を特定できた。エージェントのワークフローが複雑になるほど、この情報の価値は高まる。
AIエージェントが新たな攻撃経路を可能にする仕組み
第4四半期には、モデルがエージェントとして動作するようになって初めて可能になる攻撃も初めて確認された。
研究者は、接続された文書ストアから機密データを抽出しようとする試み、プロンプト内に埋め込まれたスクリプト形式の断片、エージェントが処理する外部のウェブページやファイル内に置かれた隠し命令を観測した。
これらは間接的なプロンプトインジェクションの初期例であり、悪意ある指示がユーザーからの直接入力ではなく、信頼できない外部コンテンツを通じて届く。
注目すべきことに、こうした間接攻撃は成功に必要な試行回数が少ないことが多く、2026年に向けて外部データソースが主要なリスク経路となることを浮き彫りにした。
AIエージェントのサイバーレジリエンスを構築する
AIシステムが単純なチャットインターフェースからエージェント型のワークフローへ進化するにつれ、それらがもたらすセキュリティー課題はより広範かつ複雑になる。
モデルがデータを取得し、ツールを呼び出し、外部入力に基づいて行動できるようになると、従来のプロンプトレベルの防御ではもはや不十分だ。
AIエージェントを導入する組織は、こうしたシステムのセキュリティー確保の方法を見直し、あらゆるインタラクションを拡大した攻撃対象領域の一部として扱わなければならない。
- エージェントのインタラクションチェーン全体にセキュリティー制御を拡張する。これには、プロンプト、検索ステップ、ツール呼び出し、出力が含まれる。
- すべての外部コンテンツを検証、サニタイズし、信頼レベルを割り当てる。エージェントがそれを取り込んだり、操作したりする前に実施する。
- 最小権限アクセスと厳格なポリシーベースの制御を適用し、ツールの実行、データアクセス、ワークフローの各ステップを管理する。
- エージェントの実行環境を分離してサンドボックス化し、影響範囲を限定する。操作や悪用が発生した場合に備える。
- 監視エージェントの挙動を、予期せぬ役割変更、通常とは異なるツール使用、隠された命令の持続などの異常がないか確認する。
- AI固有のインシデント対応とテストプログラムを実施する。これにはレッドチーム演習、ログ記録、エージェント型システムに合わせた対応プレイブックが含まれる。
これらの制御を組み合わせることで、組織はエージェント主導の攻撃が拡大する範囲と、引き起こせる被害の大きさを抑え、サイバーレジリエンスを構築できる。
AIエージェントの能力が高まるなか、リスクの低減には、イノベーションを可能にするのと同じ効果で、悪用を検知、封じ込め、復旧できるシステムを設計することが欠かせない。
AIの複雑化が攻撃対象領域を拡大
この調査によると、2025年第4四半期には1つの現実が明確になった。攻撃者の手法は、AIの能力の進歩と同じペースで進化している。
エージェント型システムが成熟し、より複雑なワークフローを担うようになると、その複雑さ自体がリスクの源になる。従来のセキュリティー制御が防御するよう設計されたことのない、操作の新たな経路が開かれるためだ。
組織がこの拡大するAI主導の攻撃対象領域に立ち向かうなか、ゼロトラスト原則を採用することは、暗黙の信頼を制限し、複雑化が進むシステム全体のリスクを低減するための体系的な方法となる。





