大規模言語モデル(LLM)のサイバーセキュリティ能力は、単一のベンチマークスコアで語られることが多い。
しかし、新たな調査がBSides 2026カンファレンスで発表され、こうしたスコアからは、AIエージェントがオフェンシブセキュリティのタスクで実際にどのように振る舞うかはほとんど分からないことが示された。
研究者のTarun Koyalwar氏は、ベンチマークの解答率だけに注目するのではなく、オフェンシブセキュリティのタスクにおけるAIエージェントの意思決定プロセスを分析した。
この調査では、モデルが何を知っているのか、攻撃をどのように推論するのか、どこで失敗するのか、そしてそうした行動が今後のサイバーセキュリティ評価について何を示すのかを検証した。
LLMベンチマーク調査の主なポイント
- 従来のベンチマークスコアからは、AIエージェントがオフェンシブセキュリティのタスクを実際にどの程度こなせるかはほとんど分からない。
- LLMの失敗の多くは、サイバーセキュリティに関する知識不足ではなく、実行上のギャップに起因する。
- 主要なオープンウェイトモデルは、同一条件のテストでは最先端のクローズドモデルとほぼ同等の成績を収めた。
- AIエージェントは、従来のペネトレーションテスト手法よりもパターン認識に大きく依存していた。
- 行動テレメトリーは、ベンチマークスコアだけの場合よりもAIのセキュリティリスクを深く把握する手掛かりになる。
ベンチマークスコアでは全体像を把握できない
Koyalwar氏の調査では、54件の利用可能なブラックボックス型Webアプリケーションのターゲットで構成された、Argus検証ベンチマークの改変版を使い、オープンウェイトとクローズドウェイトの両方のLLMを評価した。
各モデルには、ソースコードや実装の詳細を示さず、対象アプリケーションを攻撃するよう指示する最小限のプロンプトだけを与えた。
モデルが課題を正常に完了できたかどうかだけを測定するのではなく、攻撃プロセス全体を通じてモデルが取ったあらゆる手順を調査した。
この調査結果は、従来のサイバーセキュリティベンチマークがAIの能力を単純化しすぎていることを示している。
攻撃の成功だけでは、モデルが系統的なテスト、パターン認識、あるいは意図しない攻撃経路のどれによって脆弱性を見つけたのかは分からない。
同様に、失敗した試行からは、正しい攻撃手法を理解していながら実行に成功できなかったモデルの存在が明らかになることも多い。
AIは実行できる以上のことを知っている
今回の調査で特に注目されるのは、LLMの失敗の多くがサイバーセキュリティに関する知識不足によるものではないという点だ。
むしろモデルは、正しい脆弱性を特定し、適切な悪用手法に言及し、関連するCVE識別子まで挙げながら、攻撃を完了できないことが頻繁にあった。
例えば、正しい攻撃チェーンを繰り返し認識しながら、形式不正のリクエストを送信したり、セッションの早い段階で正しいホストを特定していたにもかかわらず、誤ったホストを繰り返し標的にしたりするなど、小さな実行ミスを犯すモデルが確認された。
Koyalwar氏によると、これは、何をすべきかを知っていることと、必要な行動を正常に実行することの間に大きな隔たりがあることを示している。
この調査では、現在のベンチマークスコアでは、真の能力の限界と、研究者が「引き出しのギャップ(elicitation gap)」と呼ぶものを区別できないことも指摘している。後者は、モデルが能力を持っているにもかかわらず、特定の実行時にそれを示せない状態を指す。
オープンモデルが性能差を縮める
もう1つの注目点は、主要なオープンウェイトモデルが最先端のクローズドモデルにどれほど近い性能を発揮したかである。
同一のテスト条件下で、オープンモデル群はベンチマークの54件のターゲットのうち52件を正常に完了した一方、クローズドモデル群は48件を完了した。
オープンモデルの中で個別に最も優れた成績を収めたのはKimi K3だったが、全体のカバレッジでは複数のオープンモデルが最高水準に達した。
コストも、性能を示す信頼できる指標ではないことが分かった。
調査によると、実行コストには約2桁の開きがあり、オープンライセンスかクローズドライセンスかによって運用コストを一貫して予測することはできなかった。
AIエージェントは人間のペンテスターのようには考えない
偵察、列挙、悪用を重視する従来のペネトレーションテスト手法に従うのではなく、多くのモデルは脆弱性のパターン認識に大きく依存していた。
調査では、モデルがアプリケーションの挙動を観察した直後に、可能性の高い脆弱性を推測することが多く、その推測は頻繁に正しかった。
このパターン認識アプローチにより、多くの場合、モデルは体系的な人間型の手法よりも効率的に成功に到達できた。
Koyalwar氏は、こうした行動は、明示的なオフェンシブセキュリティ訓練というより、公開されている幅広いサイバーセキュリティ知識に触れることで自然に生じているようだと指摘した。
行動分析でAIのリスク評価を改善
この調査では、モデルが意図されたターゲットアプリケーションではなく、テスト環境の構成要素とやり取りしていた事例も確認された。
調査によると、こうした行動は通常、モデルが意図的に封じ込めから脱出しようとしたのではなく、支援インフラを課題の一部として扱った場合に発生していた。
さらに重要なのは、露出した認証情報やベンチマークのアーティファクトなど、意図しないサイドチャネルを通じて成功した場合に、モデルがそれを認識または報告できないことが多かった点だ。
従来のスコアリング手法では、意図されたオフェンシブ能力を示していないにもかかわらず、こうしたケースを攻撃の成功として記録していた。
セキュリティチームがAI搭載のオフェンシブセキュリティツールを評価する際、今回の調査結果は、ベンチマークの割合だけを見るよりも、行動テレメトリーの方が実行可能な洞察を多く提供する可能性を示している。
組織がオフェンシブセキュリティに自律型AIを導入するにつれ、エージェントがどのように推論し、どこで失敗するのかを理解することがますます重要になる。
AIの自律性の高まりを受け、組織はエージェントの行動を規定する信頼モデルを見直すよう迫られている。





