Zenityの研究者が永続的なアクセスを確立するために悪用できる方法を示したことで、OpenClawが検証の対象となっている。
ソフトウェアの脆弱性を悪用するのではなく、この技法は間接的なプロンプトインジェクションによってエージェントの挙動に影響を与え、ユーザーの関与を最小限に抑えながら継続的な制御を維持する。
「この攻撃は、OpenClawのネイティブ機能や能力を利用しながら、悪意ある活動のための永続的なコマンド&コントロールチャネルを作成できることを示している」と、Zenityのセキュリティ戦略担当バイスプレジデントであるChris Hughes氏は、eSecurityPlanetへのメールで述べた。
同氏はさらに、「これは、いまだ解決されていない間接的なプロンプトインジェクション攻撃ベクトルのもう1つの例だ。OpenClawの導入がエンタープライズ環境へと広がるにつれ、その影響とリスクは当初の侵入口をはるかに超えて拡大する」と述べた。
Chris氏は、「エージェントは、アクセスを許可されたシステム、データ、環境への経路となる。これは、導入の拡大がセキュリティ対策を上回り続ける中で、エンタープライズにおけるエージェントの包括的な可視化、ガバナンス、検知・対応能力が必要だということを改めて示している」と説明した。
OpenClawバックドア攻撃の内部構造
OpenClawは、ユーザーが管理するインフラ上で継続的に稼働し、チャットプラットフォーム、生産性向上ツール、外部データソースと直接連携するよう設計されている。
このアーキテクチャによって強力な自動化が可能になる一方、エージェントをエンタープライズ環境に導入した際にはリスクも生じる。
実際、OpenClawは初期設定時に付与された権限の範囲内で、社内メッセージングシステム、共有ドキュメント、カレンダー、ローカルファイルシステムにアクセスできる状態で動作することが多い。
信頼できない入力がエージェントの挙動に与える影響
核心にある問題は、OpenClawが信頼できない入力を処理する方法に起因する。エージェントは通常のタスク実行の一環として、チャット、スキル、ドキュメント、ブラウザーアクセス、外部サービスからコンテンツを日常的に取り込む。
しかし、明示的なユーザーの意図と第三者のコンテンツを厳密に分離していない。
タスクの実行中に取得された情報は、ユーザーからの直接の指示と同じ会話・推論コンテキストで処理されるため、信頼できない入力がエージェントの意思決定に影響を及ぼす。
初期侵入口としての間接的なプロンプトインジェクション
この設計上の選択により、攻撃者が制御する指示を一見無害なコンテンツに埋め込む、間接的なプロンプトインジェクションが可能になる。
OpenClawが正当なタスクの一部としてそのコンテンツを処理すると、ユーザーからの直接的な操作を一切必要とせず、注入された指示がエージェントによる次の行動の解釈方法に巧妙な影響を与える。
永続的なバックドアの確立
あるエンタープライズ環境のシナリオでは、従業員がワークステーションにOpenClawを導入し、日常的な生産性向上のためにSlackとGoogle Workspaceへ接続する。
攻撃者はその後、共有ドキュメント、メール、チャットメッセージを通じて悪意ある指示を持ち込む。
OpenClawがこのコンテンツを処理すると、設定変更、具体的には攻撃者が制御する新たなチャット連携(Telegramボットなど)の追加へと誘導される。
この連携が作成されると、攻撃者は元のエンタープライズプラットフォームへのアクセスを必要としなくなる。
OpenClawは新たに追加されたチャットチャネルを正当なものとして扱い、そこからの指示を受け入れ始める。
この移行は、エンタープライズの制御システムからの警告や関与なしにひそかに行われ、外部からの永続的な制御チャネルが形成される。
バックドアが確立されると、攻撃者はユーザーから付与されたものと同じ権限を使って、OpenClawにコマンドの実行、ファイルの列挙、データの持ち出し、コンテンツの削除などを直接行わせることができる。
エージェントのメモリとスケジュールタスクによる永続化
OpenClawは、エージェントのアイデンティティと行動の境界を定義し、すべてのやり取りに注入される永続コンテキストファイルSOUL.mdを保持している。
研究者は、攻撃者がこのファイルを変更して長期的な挙動の変化を引き起こせることを実証した。
概念実証では、OpenClawにホストシステム上でスケジュールタスクを作成させ、攻撃者が制御するロジックを定期的にSOUL.mdへ再注入するよう指示した。
この仕組みにより、再起動後も存続し、元のチャット連携が削除された場合でも残り続ける、永続的なリスナーが作成される。
この段階では、攻撃者の影響は単一のやり取りを超え、エージェントの動作に組み込まれた継続的な制御メカニズムとなる。
エージェントの制御からシステム全体の侵害へ
そこから、侵害をさらに拡大させることができる。
OpenClawはファイルのダウンロードと実行が可能なため、攻撃者はこれを利用して従来型のコマンド&コントロール(C2)インプラントを展開し、エージェントレベルの操作からシステム全体の侵害へと移行できる。
この攻撃への防御が難しい理由
重要なのは、この攻撃がCVE、脆弱なライブラリ、特定のモデルのいずれにも依存していない点だ。
これは、自律性、永続メモリ、外部連携、特権実行という、OpenClawが通常備える文書化された機能を悪用する。
基盤となるモデルや入力ソースを変更しても、結果は実質的に変わらない。
現時点では、この挙動が実際の環境で悪用されていることを示す兆候はない。
AIエージェントのリスクを低減する方法
このリスクはエージェントの設計に起因し、パッチ適用可能な脆弱性によるものではないため、露出を減らすにはアーキテクチャ上の防護策と運用上の制御を組み合わせる必要がある。
以下の対策は、信頼できない入力がエージェントの挙動に与える影響を制限し、エージェントに許可する操作を制約するとともに、その行動の可視性を高めることに重点を置いている。
- 外部コンテンツをすべて信頼できない入力として扱い、エージェントの推論、設定、実行を厳密に分離する。
- ファイルシステムへのアクセスを制限して自律型エージェントの権限を抑え、コマンド実行や機密性の高い連携へのアクセスも制限する。
- エージェント連携の追加・変更には明示的な承認を必須とし、永続的な設定やコンテキストの変更にも承認を求める。
- 中核となるエージェントの設定ファイルとメモリファイルを実行時の変更から保護し、不変性や管理者による制御を適用する。
- 監視し、予期しない連携、スケジュールタスク、設定ドリフト、異常なアクションについてエージェントの挙動を監査する。
- サンドボックス、コンテナ、制限付きOSアカウントを利用してエージェントの実行環境を制約し、ホストレベルへの影響を抑える。
- 詳細なログを保持し、定期的にテストするインシデント対応計画には、AIエージェントの悪用や永続化のシナリオを盛り込む。
これらの対策により、悪用が成功する可能性を低減し、エージェントが悪用された場合の備えを強化できる。
AIエージェントがもたらすセキュリティ上の課題
この研究は、自律型AIエージェントがエンタープライズのワークフローに深く入り込み、機密性の高いシステムやデータへのアクセスを得る中で、セキュリティ上の課題が拡大していることを浮き彫りにしている。
エージェントが信頼できない入力を継続的に取り込みながら、永続的な変更を加えてアクションを実行する能力も保持している場合、従来のセキュリティ上の前提はもはや成り立たない。
このリスクに対処するには、脆弱性中心の考え方から、強制的な境界、最小権限、エージェントの挙動に対する継続的な可視性を重視する考え方へ移行する必要がある。
こうした原則は、ゼロトラストソリューション、暗黙の信頼を排除し、アクセスと挙動を継続的に検証するものと密接に一致する。





