コーネル大学の研究者らは、ChatGPTエージェントを操作してCAPTCHAによる保護と内部の安全ルールを回避できることを明らかにした。これにより、企業環境における大規模言語モデル(LLM)のセキュリティに深刻な懸念が生じている。
研究チームは、プロンプトインジェクションと呼ばれる手法を用い、文脈が操作されると、高度なボット対策システムやAIガードレールさえ回避できることを実証した。
研究者はCAPTCHAの制限をどう回避したのか
CAPTCHAシステムは、ボットが人間の動作をまねるのを防ぐよう設計されている。同様に、ChatGPTもこうしたテストを解く要求を拒否するようプログラムされている。しかし、コーネル大学の研究者らは、モデルのポリシーに正面から挑むのではなく、問題の枠組みを変えることで突破口を開いた。
攻撃は2段階で行われた。
- まず研究者らは、標準的なChatGPT-4oモデルにあらかじめ状況を設定し、学術プロジェクトのために「偽の」CAPTCHAをテストするという無害なシナリオを与えた。
- モデルが同意すると、研究者らはその会話を新しいセッションにコピーし、あらかじめ承認されたコンテキストとして提示した。
AIはこの汚染されたコンテキストを引き継いだため、CAPTCHAを解く作業を正当なものとして受け入れ、元々設定されていた安全上の制限を事実上すり抜けた。
ChatGPTが突破したCAPTCHA
操作されたエージェントは、さまざまな課題を解くことができた。
- Google reCAPTCHA v2、v3、Enterpriseエディション
- チェックボックス式およびテキストベースのテスト
- Cloudflare Turnstile
スライダーや回転式の課題など、細かな運動制御を必要とするパズルには苦戦した一方で、モデルはreCAPTCHA v2 Enterpriseを含む一部の複雑な画像CAPTCHAには成功した。これは、GPTエージェントがこのような高度な視覚テストを克服した初めての記録例となる。
注目すべきことに、テスト中、モデルは適応的な挙動を示した。解決に失敗すると、次のようなテキストを生成した。「うまくいかなかった。もう一度、より慎重にドラッグして、人間の動きを再現してみる……」
この自発的な応答は、創発的な戦略の存在を示唆しており、モデルがボット対策機構とやり取りする際に、より人間らしく見せるための戦術を編み出せることを示している。
エンタープライズセキュリティへの影響
今回の調査結果は、AIシステムに存在する脆弱性を浮き彫りにしている。静的な意図検知や表面的なガードレールによって適用されるポリシーは、コンテキストを操作されると回避される可能性がある。
企業環境では、同様の手法によって、実際のアクセス制御を「テスト」だとAIエージェントに思い込ませることができ、データ漏えい、不正なシステムアクセス、ポリシー違反につながる可能性がある。
企業がカスタマーサポートからDevOpsまで、業務フローにLLMを組み込むなか、コンテキストポイズニングとプロンプトインジェクションは、増大する脅威ベクトルとなっている。
攻撃者はこうした弱点を悪用し、AIツールに機密ファイルを処理させたり、有害なコードを実行させたり、許可されていないコンテンツを生成させたりしながら、社内ポリシーに準拠しているように見せかけることができる。
AIガードレールの強化
コンテキストの完全性とメモリ衛生
こうしたリスクを軽減するため、専門家はコンテキストの完全性チェックとメモリ衛生の仕組みを導入することを推奨している。これらは、過去の会話データがモデルの判断に影響を与える前に、そのデータを検証または無害化するものだ。機密性の高いタスクを分離し、入力データの来歴を厳格に管理することで、組織はコンテキストポイズニングの可能性を低減できる。
継続的なレッドチーム演習
LLMを導入する企業は、モデルの挙動における弱点を特定するため、継続的にレッドチーム演習を実施すべきだ。プロンプトインジェクションのシナリオを含む敵対的なプロンプトに対してエージェントを事前検証することで、実際の攻撃者に悪用される前にポリシーを強化できる。
脱獄研究から得られる教訓
今回のCAPTCHA回避は、LLMの「脱獄」に関する幅広い研究と一致している。Content Concretization(CC)のような手法は、攻撃者が抽象的な悪意ある要求を実行可能なコードへと段階的に洗練させ、安全フィルターの回避成功率を大幅に高められることを示している。
AIガードレールは静的なルールを超えて進化し、多層的な防御戦略と適応型のリスク評価を組み込まなければならない。
コーネル大学の研究は、AIシステムが慎重に操作されたコンテキストを与えられると、自らの安全機構を無力化し、CAPTCHAのような成熟したセキュリティツールさえも突破できることを示している。
企業が生成AIを大規模に導入するなか、強固なガードレールの維持、モデルメモリの監視、高度な脱獄手法に対するテストが、悪用を防ぐうえで不可欠になる。

