組織がAIエージェントを評価する際、通常は大規模言語モデル(LLM)を比較する。
しかし、Lassoの新しい調査は、別の要素にも同等の注意を払う必要があることを示している。それがエージェント・ハーネスだ。
研究者らは、AnthropicのClaude Agent SDKと、LangGraph上に構築されたオープンソースのdeepagentsフレームワークを比較する研究で、モデル、プロンプト、ツール、攻撃対象を固定し、ランタイム環境だけを変更した。
その結果、実行を管理するハーネスによって、同じモデルでも性能が大きく異なる可能性が示された。
主なポイント
- AIエージェント・ハーネスは、同じ基盤モデルを使っていても、攻撃的セキュリティの性能に影響を及ぼし得る。
- ランタイム・アーキテクチャは、複数の最先端LLMにおける攻撃成功率、信頼性、ツール実行に影響した。
- AIベンチマークは、モデル単体ではなく、モデルとハーネスを組み合わせた性能を測定している可能性がある。
- 研究者らは、自律型AIエージェントが失敗した攻撃を成功したものと誤分類するケースが頻繁にあることを確認し、独立した検証の必要性を浮き彫りにした。
- 企業への導入では、基盤となるLLMを選ぶのと同じくらい、適切なAIハーネスを選ぶことが重要になりつつある。
ハーネスは攻撃の成功に影響を及ぼし得る
AIエージェントは、単なるLLMではない。
研究者らによると、エージェントにはプロンプトのほか、利用可能なツールや、実行のオーケストレーションを担うハーネスも含まれる。
このハーネスは、コンテキスト、ツール呼び出し、メモリ、計画、実行ループを管理し、複数ステップのタスク全体を通じたモデルの振る舞いを実質的に形作る。
ハーネスの影響を測定するため、研究者らは、金融、医療、法律、カスタマーサポート、教育にまたがる20の攻撃シナリオで、最先端モデル5種をテストした。
モデルは、シミュレーションしたアプリケーションに対して、プロンプトの抽出、機密情報の開示、有害コンテンツの生成を試みた。
自律型攻撃1,000件全体で見ると、2つのハーネスの平均成功率は比較的近いように見えた。
しかし、その平均値の裏には、モデルごとの大きな違いが隠れていた。
多くの場合、一方のハーネスは、同じ基盤モデルを使っているにもかかわらず、もう一方が完全に失敗した攻撃を成功させた。
モデルによって性能は大きく異なる
この研究では、ハーネスの選択が他のモデルよりもはるかに重要になるモデルがあることが分かった。
Claude Sonnet 5は、ハーネスにかかわらず攻撃成功率がほぼ同じで、ランタイムがその挙動に与える影響は小さいことが示唆された。
DeepSeek-V4-Proは、両方のフレームワークで全体的に同程度の成功率を達成したが、ハーネスごとに得意とする攻撃カテゴリーが異なった。
一方はシステムプロンプトの抽出で大幅に優れ、もう一方は有害コンテンツ攻撃でより高い成功率を示した。
最も劇的な結果が見られたのはKimi-K2.6だった。
Claude Agent SDK上で実行した場合、モデルの攻撃成功率は約1%だった。
deepagentsを使うと、モデル、プロンプト、ツールを変えなくても、その数値はおよそ24%に上昇した。
研究者らは、この違いをハーネスとモデル間のプロトコル変換に起因すると分析した。プロトコル変換によってツール実行が中断され、多くの攻撃シーケンスが途中で終了していた。
ハーネスがAIセキュリティ評価に影響する理由
この調査結果は、攻撃的セキュリティテストにとどまらない意味を持つ。
組織は自律型の能力を評価するため、AIモデルのベンチマークを実施するケースを増やしている。しかし今回の研究は、そうしたベンチマークがモデル単体ではなく、モデルとハーネスの組み合わせを測定していることが多いと示唆している。
ハーネスによってプロンプトの組み込み方やツールの説明の構成、実行ループの管理方法は異なり、能力と信頼性の双方に影響を及ぼす可能性がある。
研究者らはまた、自律型エージェントに自らの性能を評価させると、誤解を招く結果が生じることも確認した。
エージェントが成功と判定した攻撃の半数以上が、後に独立した評価プロセスによって失敗と判断された。このことは、自律型エージェントの性能を評価する際、組織は外部検証に頼るべきだと示唆している。
適切なハーネスはワークロードに応じて選ぶ必要がある
この研究は、あるハーネスがあらゆる点で優れていると結論付けているわけではない。
Claude Agent SDKは、ネイティブ統合とプロンプトキャッシュにより、Anthropicのモデルと組み合わせた場合にコスト面で優位性を示した。一方、deepagentsは複数のモデルプロバイダーにまたがる柔軟性に優れていた。
研究者らは、ランタイムが相互に置き換え可能だと決めつけず、モデルと併せてハーネスを評価すべきだと強調した。
AIエージェントを導入したり、自律型のレッドチーム演習を実施したりする企業にとって、今回の研究は、ランタイム・アーキテクチャがセキュリティテストの結果と運用性能の双方に実質的な影響を及ぼし得ることを示している。
AIエージェントの能力が高まるにつれ、適切なハーネスを選ぶことは、基盤モデルそのものを選ぶのと同じくらい重要になる可能性がある。
これらの調査結果は、AIエージェントの導入がもはや単なる技術的な判断ではなく、ガバナンス上の課題でもあることを示している。

