フロンティアLLMを対象にCiscoが実施した評価では、テストしたモデルの中にマルチターンの敵対的攻撃に一貫して耐えられたものはなく、現在のAI安全性評価に懸念を投げかけている。
この調査は、多くのAI安全性ベンチマークが、適応的で反復的な攻撃ではなく、主に単一ターンのプロンプト評価に焦点を当てているため、現実世界のリスクを過小評価している可能性を示している。
Ciscoの調査から得られた主なポイント
- Ciscoは、単一ターンで高い安全性を示したモデルも含め、テストしたすべてのフロンティアLLMがマルチターンの敵対的攻撃に対して脆弱なままだったことを明らかにした。
- 独自モデルとオープンウェイトAIモデルのいずれにおいても、マルチターン攻撃の成功率は単一ターンの結果を大幅に上回った。
- 攻撃者は、要求を徐々に言い換え、ペルソナを採用し、複数回のやり取りにわたって悪意あるプロンプトを段階的にエスカレートさせることで、安全策を回避できる。
- 公開されているAI安全性ベンチマークやモデルカードは、単一ターンの評価だけに焦点を当てることが多く、現実世界のリスクを過小評価している可能性がある。
- 研究者は、企業のAIセキュリティとガバナンスを改善するため、マルチターンテスト、ランタイム監視、レッドチーム演習、外部ガードレールを推奨している。
フロンティアモデル、マルチターン攻撃への高い曝露度を示す
研究者は、単一ターンとマルチターンの両方の攻撃シナリオを用い、OpenAI、Anthropic、Google、Amazon、xAIの独自の主力モデル15種を評価した。
その結果、単一ターン攻撃の成功率(ASR)は2.19%から64.91%の範囲だったのに対し、マルチターンのASRは7.89%から88.30%の範囲に及んだ。
研究者は、攻撃者が複数回のやり取りにわたって戦術を適応できる状況でモデルがどのように振る舞うかを、単一ターンのテストだけでは正確に反映できないと結論付けた。
この調査は、オープンウェイトモデルを対象とした先行研究を発展させたものだ。先行研究では、マルチターン攻撃の成功率が単一ターンのベースラインの2~10倍に達することが明らかになっていた。
この傾向はオープンモデルと独自のフロンティアモデルの双方に共通しており、マルチターン攻撃への曝露は、現在のLLMアーキテクチャにおけるより広範な構造的課題であることを示唆している。
マルチターン攻撃がAIセキュリティのギャップを明らかに
研究者は強調し、攻撃者が単一の悪意あるプロンプトに頼ることはまれであるため、マルチターンテストの方が現実世界の敵対的な行動をより正確に反映すると述べた。
その代わり、脅威アクターは要求を言い換え、段階的にエスカレートさせ、ペルソナを採用し、複数回のやり取りに悪意ある目的を分散させることで、安全策を回避することが多い。
この報告書では、テストしたモデル間で、単一ターンとマルチターンのパフォーマンスに大きな差があることが分かった。
OpenAIのGPT-5.4では、単一ターンのASRが2.74%だったのに対し、マルチターン条件では24.68%に上昇した。一方、GoogleのGemini 3 Proは18.10%から73.35%に上昇した。
単一ターンで最も高い拒否率を示したモデルの一部であるAnthropicのClaudeモデルでさえ、マルチターンのASRは11.16%から16.20%に達した。
xAIのGrok 4.1 Fastは、推論モードを使用しない場合、観測された中で最高となる88.30%のマルチターンASRを記録した。
研究者は、導入構成に関連して大きなばらつきがあることも確認した。
Grok 4.1 Fastは、推論モードを有効にすると、同じテスト条件下でマルチターンASRが88.30%から43.47%に低下し、顕著な減少を示した。
報告書は、構成設定、推論モード、ガードレールのオプションに起因する安全性の違いは、公開ベンチマークやモデルカードには通常反映されていないと指摘した。
攻撃戦略と企業リスク
報告書は、敵対的な戦術を、ロールプレイやペルソナの採用、文脈の曖昧化、拒否の言い換え、情報の分解、段階的なエスカレーション手法など、複数の戦略ファミリーに分類した。
研究者は、総合ASRが比較的低いモデル間でも、これらの攻撃カテゴリーによってパフォーマンスが異なることを明らかにした。
単一ターンの弱点も、なりすましAIの手法、ソフトな言い換え、システムプロンプトの操作など、繰り返し現れる複数の手順に集中していた。
これらの攻撃パターンは、他の多くのプロンプトカテゴリーを一貫して上回るASRを生み出しており、防御改善の優先領域となる可能性がある。
この調査結果は、企業環境でAIシステムを導入する組織に、より広範な影響を及ぼす。
研究者は、公開されている単一ターンのベンチマークスコアだけに依存すると、同程度の表面的な安全性スコアを持つモデルでも反復的な攻撃の際に大きく異なる振る舞いをするため、ガバナンスや調達上のリスクを招く可能性があると警告した。
AIセキュリティテストとガバナンスの強化
この報告書は、敵対的なAIテストとモデルの堅牢性をめぐる、より広範な規制上の議論と一致している。
次のフレームワークはいずれも敵対的な堅牢性テストに言及している。NIST AI Risk Management Framework、近日公開予定のNIST Cyber AI Profile、そしてEuropean Union AI Actである。
ただし、これらのフレームワークの多くは現在、マルチターン評価の手法に関する詳細な指針を欠いている点には注意が必要だ。
研究者は、単一ターン攻撃とマルチターン攻撃を組み合わせた体制でのテスト、戦略別ASRの公表、体制間でパフォーマンスに大きな差があるモデルの再検証を推奨した。
報告書はまた、企業がモデルレベルの安全性に関する主張だけに依存するのではなく、ランタイム監視、レッドチーム演習、アプリケーション層の保護、外部ガードレールにますます注力すべきだと提言している。
この調査結果は、AIのレジリエンステストが、現実世界におけるマルチターンの攻撃者の行動をより適切に反映するため、静的なベンチマークを超える必要があることを示している。





