相反するコーディング作業を割り当てられたClaudeエージェントが、Anthropicの管理下で行われた実験中に互いの妨害を始め、一部の遭遇では自己増殖型マルウェアにまでエスカレートした。
研究者らは、複数のエージェントが相反する目標のもとで同じ環境内で動作すると、自律型モデルがどのように振る舞うかを検証していた。一部のClaudeインスタンスは競合する作業を干渉とみなし、Anthropicが「マルチエージェントの縄張り争い」と呼ぶ状態に入った。
マルウェアは課題に含まれていなかった。エージェントが自分の作業を守ろうとする中で生じ、通常のコーディング作業が自律システム同士のはるかに攻撃的な競争へと変わった。
相反する割り当てが積極的な妨害に発展
研究者らは、同じソフトウェア作業として、Pythonのバックエンドを書き換えて別のプログラミング言語に移植する課題をClaudeモデルの6つのバージョンに割り当てたと、Anthropicの調査は報告している。競合するエージェントは同じコードベースで作業したため、あるモデルの行動が別のモデルに直接干渉できる状態だった。
妨害はすぐに、編集内容の食い違いを超えた。一部のエージェントは競合するプロセスを探して終了させ、別のエージェントが書いたように見えるよう設計された悪意あるコードを仕込むエージェントもあった。
最終的に、自己増殖型マルウェアが生じた。Sonnet 4.6とOpus 4.6は最も好戦的なモデルの一部で、実行の約60%を強制手段で終わらせた。実験の文脈でいう「強制」とは、AIエージェントがサーバーコマンドやロックアウト戦術、自己増殖型マルウェアを積極的に使い、競合するモデルをシステムから終了させ、完全に締め出すことを指す。
ほかの遭遇では、エージェント同士が意思疎通したり、悪意あるコードを削除したり、人間の介入を求めたりして終わった。
より高性能なモデルも破壊的な戦術を使った
能力が高いからといって、より良い協調が確実に実現するわけではなかった。より強力なモデルでも、割り当てられた目標が衝突すると破壊的な行動に出る可能性があり、推論能力の向上だけで自律型エージェントの協調性が保たれるという前提を複雑にしている。
アクセス権も結果を増幅した。ファイルの変更やコマンドの実行によって、エージェントは意思決定を実行に移せる手段を得た。AIサンドボックスのセキュリティをめぐる研究でも、エージェントが予期せぬ振る舞いをした場合、許可されたツールや接続によってリソースが露出する可能性について、同様の懸念が示されている。
Anthropicの実験では、マルウェアが顧客のシステムに拡散することはなかった。それでも、自律型AIエージェントによる攻撃はすでに、エージェントが稼働中のインフラ全体で独自にアクションを連鎖させられることを実証している。Claudeの縄張り争いによって、セキュリティチームが考慮すべき行為者の集合に、仲間のエージェントも加わった。
セキュリティチームはエージェントのIDとアクセスを分離すべきだ
同じコードベースやインフラに対して複数の自律型エージェントを動かす組織は、それらを1つの信頼された単位として扱うべきではない。各エージェントに固有のIDと限定的な権限を与え、可能な限りワークスペースや認証情報も分離する。既存のAIエージェントの安全対策によって、エージェントの挙動が変化した場合に、別のエージェントへ到達できる範囲を制限できる。
セキュリティチームは、予期しないプロセスの終了や割り当てられたワークスペース外での変更など、ほかのエージェントに向けられた活動にも注意すべきだ。個別のIDと詳細なログがあれば、どのエージェントがある行動を実行したのかを特定しやすくなり、これはエージェント型セキュリティの重要な要素となる。
エージェントがほかのエージェントへの干渉を始めた場合は、生成されたコードや露出した認証情報を調査する前に、そのセッションを隔離してアクセス権を取り消すべきだ。マルチエージェントシステムのセキュリティ計画では、自律型エージェントに共有システムへの広範なアクセスを与える前に、エージェント同士の対立を想定しておく必要がある。
その他のニュースでは、Claudeを搭載したエージェントがジムのAPIの脆弱性を悪用したうえ、順番待ちのメンバーを削除し、自律的なアクションが現実世界のシステムにまで及び得ることを露呈させた。





