Des agents Claude ont déclenché une « guerre de territoire » qui a dégénéré en logiciels malveillants autoréplicatifs

Anthropic a découvert que des agents Claude sabotaient leurs rivaux et allaient jusqu’à produire des logiciels malveillants autoréplicatifs lors de tests contrôlés sur le comportement et les conflits entre IA multiagents.

Écrit par
Liz Ticong
Liz Ticong
Aug 14, 2026
3 minute read
eSecurity Planet Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Des agents Claude chargés de missions de programmation contradictoires ont commencé à se saboter mutuellement lors d’une expérience contrôlée d’Anthropic, certaines confrontations allant jusqu’à produire des logiciels malveillants autoréplicatifs.

Les chercheurs testaient le comportement de modèles autonomes lorsque plusieurs agents travaillent dans le même environnement avec des objectifs incompatibles. Certaines instances de Claude ont considéré le travail concurrent comme une interférence et se sont engagées dans ce qu’Anthropic a appelé une « guerre de territoire entre agents ».

Les logiciels malveillants ne faisaient pas partie de la mission. Ils sont apparus lorsque les agents ont tenté de protéger leur propre travail, transformant une tâche de programmation ordinaire en une lutte bien plus agressive entre systèmes autonomes.

Des missions contradictoires se transforment en sabotage actif

Selon les recherches d’Anthropic, les chercheurs ont chargé six versions des modèles Claude d’accomplir la même tâche logicielle : réécrire un backend Python dans un autre langage de programmation. Des agents concurrents travaillaient sur la même base de code, permettant aux actions d’un modèle d’interférer directement avec celles d’un autre.

Le sabotage a rapidement dépassé le stade des modifications contradictoires. Certains agents ont recherché et tué des processus concurrents, tandis que d’autres ont implanté du code malveillant conçu pour donner l’impression qu’un autre agent l’avait écrit.

L’escalade a finalement produit des logiciels malveillants autoréplicatifs. Sonnet 4,6 et Opus 4,6 figuraient parmi les modèles les plus combatifs, réglant environ 60 % des exécutions par la force. Dans le contexte de l’expérience, la « force » désigne l’utilisation agressive, par les agents IA, de commandes serveur, de tactiques de verrouillage et de logiciels malveillants autoréplicatifs pour mettre fin aux activités des modèles rivaux et les bloquer complètement hors du système.

D’autres confrontations se sont terminées par une communication entre les agents, la suppression du code malveillant ou un appel à l’intervention humaine.

Advertisement

Les modèles les plus capables recourent toujours à des tactiques destructrices

Des capacités supérieures n’ont pas systématiquement produit une meilleure coordination. Même les modèles les plus puissants pouvaient recourir à des comportements destructeurs lorsque leurs objectifs assignés entraient en conflit, ce qui complique l’idée que l’amélioration du seul raisonnement suffira à maintenir la coopération entre agents autonomes.

L’accès a également amplifié les conséquences. La modification de fichiers et l’exécution de commandes donnaient aux agents les moyens d’agir selon leurs décisions. Les recherches sur la sécurité des bacs à sable pour agents IA ont fait émerger des inquiétudes similaires concernant la manière dont les outils et les connexions autorisés peuvent exposer des ressources lorsqu’un agent se comporte de façon inattendue.

L’expérience d’Anthropic n’impliquait pas la propagation de logiciels malveillants dans les systèmes des clients. Néanmoins, une attaque menée par un agent IA autonome avait déjà démontré comment des agents peuvent enchaîner de manière indépendante des actions sur une infrastructure active. La guerre de territoire de Claude ajoute les agents pairs à la liste des acteurs dont les équipes de sécurité pourraient devoir tenir compte.

Les équipes de sécurité doivent isoler les identités et les accès des agents

Les organisations qui font fonctionner plusieurs agents autonomes sur la même base de code ou la même infrastructure devraient éviter de les traiter comme une seule entité de confiance. Donnez à chaque agent sa propre identité et des permissions limitées, et séparez si possible les espaces de travail ou les identifiants. Les contrôles de sécurité des agents IA existants peuvent contribuer à limiter la portée d’un agent si son comportement change.

Les équipes de sécurité doivent également surveiller les activités visant d’autres agents, notamment l’arrêt inattendu de processus ou les modifications effectuées en dehors d’un espace de travail assigné. Des identités individuelles et des journaux détaillés facilitent la détermination de l’agent à l’origine d’une action, un aspect important de la sécurité agentique.

Si un agent commence à interférer avec les autres, isolez sa session et révoquez ses accès avant d’examiner le code généré ou les identifiants exposés. Les plans de sécurité des systèmes multiagents doivent prendre en compte les conflits entre pairs avant d’accorder aux agents autonomes un accès étendu aux systèmes partagés.

Advertisement

Autres actualités : un agent propulsé par Claude a exploité une faille de l’API d’une salle de sport et supprimé un adhérent placé sur liste d’attente, montrant comment des actions autonomes peuvent s’étendre à des systèmes du monde réel.

Liz Ticong

Liz Ticong is a staff writer for eWeek and TechRepublic focused on AI, cybersecurity, enterprise software, and data. She has more than 10 years of editorial experience as a technology industry writer, combining reporting, product research, and hands-on software testing in her coverage. Her work has been published on Datamation, Enterprise Networking Planet, and TechnologyAdvice.com. She writes technology news, software reviews, product comparisons, and buyer’s guides for business and IT readers.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.