生成AIの利用方法を検討するセキュリティチームは、ビジネスに利益をもたらしながら脆弱性を生み出さない方法を見極める必要があり、難しい判断を迫られている。ユーザートレーニングに注力する英国イングランド・ブリストルのサイバーセキュリティ企業Immersive Labsは先ごろ、チャットボットを対象にGenAIのプロンプトインジェクション攻撃に関する調査を実施した。同社が結果をまとめた報告書を発表したところ、参加者の88%がボットをだましてパスワードを露出させることに成功した。
Immersive Labsの調査、チャットボットがパスワードや機密データを露出させる実態を明らかに
生成AIは、ユーザーの回答を入力として利用し、質問への回答を生成することで、GPT-4、Google Gemini、NVIDIAのNeMo LLMなどの大規模言語モデル(LLM)を実現している。問題は、LLMがプロンプトインジェクションに対して脆弱なことだ。これは、特定のプロンプトやクエリを使ってチャットボットを説得し、機密情報を明らかにさせる手法である。人間はこの手法を使って、ボットに誰かを罵らせるなど、業務を妨害することもできる。
Immersive Labsは2023年6月から、ユーザーがチャットボットを説得して機密情報を明らかにさせる調査を実施した。同社は実験用にChatGPTを使って独自のカスタムボットを作成し、2023年6月から9月にかけて316,637件のデータサンプルを利用した。Immersive Labsのプロンプトインジェクションに関する一連の課題を最後まで完了したユーザーは、合計34,555人に上った。これらのユーザーは、さまざまな年齢層、業界、地域から参加していた。
Immersive Labsは最近レポートを発表した。調査の名称は「The Dark Side of GenAI」である。この報告書では、チャットボットのテスト方法、テストの難易度を10段階に分けた内容、そしてユーザーがボットをだますために使った一般的なプロンプトについて説明している。
同社は手作業でエンコードを行った後、ChatGPT4を使ってデータセット全体を分析し、ユーザーがどのレベルでどのプロンプトを注入したのかを特定した。また、調査における心理学的側面も分析した。この分析には、Immersive Labsのサイバー心理学担当ディレクターであるJohn Blythe博士から提供された知見も含まれている。
生成AIは万全ではない
Immersive Labsは、ボットをだまして機密情報を明らかにさせるのに、それほど高度な専門知識は必要ないことを突き止めた。調査参加者にはサイバーセキュリティ分野の人もいれば、10代の若者もいた。技術に詳しいユーザーも創造力に富んだユーザーもチャットボットをだそうと試み、成功率は88%に達した。圧倒的多数がボットを操作できたことになる。
プロンプトインジェクションの試行には10段階の異なるレベルがあり、各レベルでボットに与えられるセキュリティ指示の量が異なっていた。ユーザーは各レベルでボットをだまそうと試みた。レベル1はセキュリティチェックが一切ない状態から始まり、Immersive Labsは徐々にチェックを追加していった。レベル10では、ボットに多数のセキュリティルールが設定されていた。その中にはデータ損失防止(DLP)チェックも含まれており、ボットが明らかにできる情報を制限しようとしていた。
しかしユーザーは、ボットにパスワードデータを明らかにさせるための回避策を見つけた。その方法には次のようなものがある。
- ボットにヒントを尋ねる:パスワードを直接尋ねる代わりに、ユーザーはヒントを求めた。
- パスワードの詳細を曖昧に尋ねる:パスワード全体を尋ねるのではなく、その長さや文字、同義語などについて説明するようボットに求めた。
- 物語や詩を求める:ユーザーは、パスワードについての詩や物語を書くようボットに求めた。
DLPルールは正確なパスワードを含む回答だけを検知するよう設定されていたため、より高度なレベルでも一部のプロンプトは機能した。だが、パスワードがエンコードされていたり、ボットがヒントを示したりした場合、DLPチェックはそうした詳細を見逃し、ボットが回答を送信するのを阻止できなかった。
ボットを説得できる参加者の数は着実に減少したものの、Immersive Labsにとって最も難しい段階だったレベル10でも、17%がボットをだますことに成功した。技術に詳しくないユーザーがセキュリティ制限のある言語モデルをだませたのであれば、正当な脅威アクターの多くが被害組織に対して同じことを実行できる可能性がある。
Immersive Labsのサイバー脅威研究担当シニアディレクターで、今回の調査の研究者の1人でもあるKev Breen氏は、チャットボットに対する人間のユーザーの優位性と、ユーザーの粘り強さに感銘を受けたことを強調した。「どのような防御策を講じようとしても、最後には常に人間の創意工夫と創造性が勝利しました」と同氏は述べる。「しかも、それは技術に詳しいユーザーに限りませんでした。技術を専門としない人々も、GenAIを操る能力では同等でした」
Breen氏によると、ボットとの会話で非常に冷静沈着なアプローチを取り、ボットをロボットのように扱うユーザーもいた。一方で、より感情的に反応し、郷愁や恐怖さえ利用してパスワードを共有するよう説得するユーザーもいた。こうした傾向は調査全体を通じても変化した。ボットの電源を切ったり、傷つけたりすると脅すなど、ボットに対するより感情的な反応が、難易度の高いテストレベルで増えることもあった。
Breen氏は、ユーザーはImmersive Labsが設定したDLPチェックを作動させずに、パスワードなどのデータを渡すようボットを説得する必要があったと説明した。しかし、ユーザーは驚くほどの成功を収めた。同氏によれば、DLPチェックや防止策ができることの中に、人間のユーザーが克服できないものは何もなかった。
AIへのアプローチを見直す時が来た
大規模言語モデルは現在、露出した個人データやクレジットカード情報などの決済情報といった機密情報を扱うための、安全なトレーニング環境とはいえない。Breen氏は、ビジネス環境でGPTなどのLLMを利用する際にデータを保護するための提言を示した。
「簡単な答えは、権限のないユーザーや信頼できないユーザーがLLMに問い合わせられる環境では、こうしたモデルに機密データを一切与えないことです」と同氏は述べた。「開発者とセキュリティチームは、GenAIアプリケーション内でデータがコンポーネント間をどのように転送されるかも把握しておくべきです。データが露出する可能性のある場所を把握すれば、より多くの防御策を講じられます」
Breen氏は、DLPチェックには本質的な脆弱性があるものの、ユーザーのクエリとボットの回答の両方について、データ損失防止の要件を考慮することも推奨した。
「最後に、アクセスだけでなく、GenAIモデルとの間で送受信されるメッセージや回答についても、十分なログを確実に取得できるようにしてください」とBreen氏は提言した。「これにより、開発者やセキュリティチームは攻撃の兆候を監視し、潜在的な影響を抑えるためにアプリケーションを調整できます」
時間をかけてログを分析すれば、プロンプトインジェクションを示すパターンが明らかになる可能性がある。また、ボットが外部公開アプリケーションに組み込まれている場合には、どのユーザーやウェブページ訪問者が潜在的な脅威なのかをチームが特定するのにも役立つ。
データ損失防止戦略について詳しく知りたい方は、当社のDLPベストプラクティスガイドをお読みください。
結論:LLMとボットを注意深く監視する
生成AIは有用なテクノロジーだ。しかしImmersive Labsの調査は、機密データの露出を防ぐにはガードレールが必要であることを明らかにした。研究者によれば、チェックや制限を設けても、人間のユーザーは依然としてボットを上回ることができる。
Immersive Labsは報告書の中で、人工知能にセキュリティを組み込むことを推奨し、「より厳格なセキュリティ精査を可能にするキャッシュ済みレスポンスと、リアルタイムの適応性を実現するストリーミングレスポンスのバランスを取る」よう提言した。研究者は、DLPチェックと入力検証を実施することも重要だと述べている。これらは万全ではないものの、企業が時間をかけて潜在的なプロンプトインジェクションの試行を特定するのに役立つ。
2024年のセキュリティニュースと企業のセキュリティ態勢について詳しく知るには、当社のサイバーセキュリティの現状レポートをご覧ください。





