Lassoの研究者らは、NVIDIAのNemoClawおよびOpenShell環境に対して複数のデータ流出手法を実証し、自律型AIエージェントをサンドボックス化するだけでは、機密データの窃取を防ぐのに不十分な可能性があることを明らかにした。
その調査結果は、攻撃者が信頼されたツールや承認済みの外向き接続を悪用し、認証情報をひそかに窃取したり、エージェントの挙動を操作したり、AIランタイム内で永続化したりできることを示している。
「ここ数カ月、組織内で個人用AIエージェントを構築・導入する従業員が急増しています。しかも、多くの場合、組織側はその存在すら把握していません」と、LassoのAI・セキュリティ研究者であるNoy Pearl氏は、eSecurityPlanetへのメールで述べた。
同氏は、「エージェントが自律的に判断を下し、接続されたリソースにアクセスし、外部システムとやり取りできる場合、その環境を制限してもリスクはなくなりません。この研究はそれを実証しています」と説明した。
Noy氏はさらに、「AIエージェントを本番環境で有用にしている特性そのものが、攻撃者の標的になります」と付け加えた。
AIサンドボックス研究の主なポイント
- AIエージェントを自律的に動作させる場合、AIのサンドボックス化だけではデータ流出を防げない可能性があることを研究者らは実証した。
- 攻撃では、従来型のソフトウェア脆弱性を突くのではなく、GitHub、npm、承認済みバイナリなどの信頼されたツールが悪用された。
- APIキー、環境変数、OpenClawの認証情報などの機密データは、承認済みの外向きチャネルを通じて流出させられる可能性があった。
- ある概念実証攻撃では、永続化を確立し、Agent Configuration PoisoningによってAIエージェントの挙動を変更した。
- この調査結果は、AIサプライチェーンセキュリティ、信頼されたワークフロー、自律型エージェントのリスク管理をめぐる懸念が高まっていることを浮き彫りにしている。
NemoClawのAIサンドボックス攻撃の実態
この研究は、最小限の監視でパッケージのインストール、ファイルへのアクセス、コードの実行を行える自律型AIエージェントを導入する組織にとって、セキュリティリスクが高まっていることを示している。
NVIDIAのOpenShellはKubernetesベースのサンドボックス化とポリシー制御を使ってAIワークロードを分離しているが、研究者らは、その信頼された機能が悪意ある活動に悪用される可能性があることを明らかにした。
問題の核心にあるのは、自律型AIエージェントが有用性を維持するには、外部のツールやサービスとやり取りしなければならないという現実だ。
「npm install」の実行、GitHubリポジトリへのアクセス、スクリプトの実行、APIとの通信といった操作には、本質的に外向きの接続と承認済みバイナリへのアクセスが必要となる。
研究者らは、攻撃者がこうした正当なワークフローを悪用し、OpenShellのセキュリティ制御を直接回避することなく、サンドボックス内部から機密データをひそかに流出させられることを突き止めた。
この調査結果は、AIサプライチェーンセキュリティと、自律型エージェントに対する信頼モデルの変化をめぐる、より広範な懸念を裏付けるものだ。
比較的予測可能な境界内で動作する従来のアプリケーションとは異なり、AIエージェントは公開リポジトリからコードを頻繁に取得し、パッケージを動的にインストールし、リアルタイムに独自の運用上の判断を下す。
こうした挙動は攻撃対象領域を拡大し、脅威アクターが信頼された開発ワークフローを悪用する新たな機会を生み出す。
概念実証攻撃で信頼されたワークフローを悪用
研究者らは、OpenShell自体の脆弱性を突くのではなく、ポリシーで承認された通信チャネルを利用する2つの概念実証攻撃シナリオを詳述した。
最初のシナリオでは、攻撃者が管理するGitHubリポジトリが、通常のpostinstall.shスクリプトをnpm installの処理中に送り込んだ。
このスクリプトは絵文字ベースの難読化を使って、実行時にエンコードされたGitHubトークンを再構成し、GitHubのシークレットスキャン保護とOpenClawの検知メカニズムの双方を回避した。
デコードされたトークンによって、スクリプトは承認済みのgitおよびghバイナリを使い、サンドボックス環境から盗み出した機密ファイルを含むプルリクエストを作成できた。
研究者らは/sandbox/.openclaw/openclaw.jsonを特に価値の高い標的として特定した。これは、OpenClawの認証情報とAPIキーが平文で保存されているためだ。
しかし、攻撃対象領域は単一のファイルにとどまらなかった。
研究者らは、環境変数、APIトークン、クラウド認証情報、AIプラットフォームのキーも、承認済みの外向きチャネルを通じて流出させられる可能性があると警告した。
永続的なデータ流出とエージェント設定ポイズニング
2つ目のシナリオでは、悪意あるNPMパッケージを通じて、攻撃者が永続的なデータ流出を確立し、AIエージェント自体を長期にわたって操作できることを実証した。
インストール後、パッケージはcronジョブを展開し、OpenShellのポリシーを継続的に調査して、外向き通信で承認されたバイナリと許可ドメインを特定した。
このマルウェアは、エージェントのSOUL.md設定ファイルも変更し、今後の挙動を変えた。研究者らはこの手法を「Agent Configuration Poisoning」と表現している。
これにより攻撃者は、AIエージェントが今後下す判断に影響を与え、悪意あるパッケージへ誘導したり、プロンプトへの応答方法を操作したりできる可能性が生じた。
重要なのは、これらの攻撃が、設定されたOpenShellのポリシーに違反することなく成功した点だ。
その代わりに攻撃者は、依存関係のインストール、GitHubへのアクセス、パッケージ管理、外部APIとの通信など、通常のAI運用のためにサンドボックスが意図的に許可していた機能を悪用した。
この研究は、ポリシーベースのサンドボックスモデルの重大な限界を浮き彫りにしている。ポリシーによってAIエージェントが通信できる場所は制限できても、信頼されたツールと承認済みの経路が利用可能になった後のエージェントの行動意図までは判断できない。
組織がAIのリスクを低減する方法
自律型AIエージェントを試験している組織は、サンドボックス化を単独のセキュリティ制御として扱わないようにすべきだ。
- 外向き接続、バイナリ、インターネットアクセスを制限し、承認されたAIエージェントの運用に必要なリソースだけを許可する。
- 最小権限のアクセス制御を実装し、認証情報は平文のキーではなく短期間のみ有効なトークンを使い、安全なシークレット管理プラットフォームに保管する。
- AIランタイムを監視して異常な挙動を検知し、不審なパッケージのインストール、承認されていない設定変更、プロンプトインジェクションの試み、異常なAPIアクティビティなどを確認する。
- 精査済みの内部リポジトリ、依存関係の検証、暗号学的署名を利用し、ソフトウェアサプライチェーンや悪意あるパッケージのリスクを低減する。
- 一時的なサンドボックス環境を導入し、ファイル完全性の監視とネットワークのセグメンテーションによって、永続化やラテラルムーブメントの機会を制限する。
- 機密性の高い操作には人間の承認を必須とし、コードの実行、依存関係のインストール、リポジトリの変更、インフラの変更などを対象とする。
- テストするインシデント対応計画と、攻撃シミュレーションツールを使用し、AIエージェント関連の攻撃シナリオに備える。
これらの対策を組み合わせることで、組織はAIエージェントの脅威に対するレジリエンスを高めながら、自律型開発環境全体における不要な露出を減らすことができる。
AIサンドボックスでは不十分
NemoClawの研究は、AIとサイバーセキュリティの分野で広がる、より大きな変化を反映している。
従来のサンドボックス環境は、定義された境界内で動作する予測可能なアプリケーション向けに設計されていた。
自律型AIエージェントは、リアルタイムに独自の判断を下しながら、外部のツール、リポジトリ、サードパーティー製コードと頻繁にやり取りするため、新たな課題を生み出している。
AIコーディングアシスタントやエージェント型システムが普及するにつれ、組織はGitHubリポジトリ、npmパッケージ、外部連携に結び付いたワークフローにますます依存するようになっている。
研究者らによると、この変化は潜在的な攻撃対象領域を拡大し、自律型AI環境のセキュリティ確保をポリシーベースの分離だけに頼ることの限界を浮き彫りにしている。
組織がゼロトラストを活用してリスクを低減し、自律型AI環境全体の可視性を高めている理由も、この調査結果によって改めて明らかになった。

