BSides 2026 : les performances réelles des agents IA en sécurité offensive

Les recherches présentées à BSides 2026 montrent que le comportement des agents IA révèle davantage que les scores de référence.

Written By
Ken Underhill
Ken Underhill
Aug 3, 2026
5 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Les capacités des grands modèles de langage (LLM) en cybersécurité sont souvent résumées par un seul score de référence. 

Cependant, de nouvelles recherches présentées lors de la conférence BSides 2026 suggèrent que ces scores en disent peu sur le comportement réel des agents IA durant des tâches de sécurité offensive. 

Plutôt que de se concentrer uniquement sur les taux de réussite aux tests de référence, le chercheur Tarun Koyalwar a analysé les processus de prise de décision des agents IA pendant des tâches de sécurité offensive. 

Ses recherches ont porté sur ce que les modèles savent, leur façon de raisonner face aux attaques, leurs points d’échec et ce que ces comportements révèlent sur les futures évaluations de la cybersécurité. 

Principaux enseignements des recherches sur les tests de référence des LLM

  • Les scores traditionnels des tests de référence en disent peu sur les performances réelles des agents IA dans les tâches de sécurité offensive.
  • De nombreux échecs des LLM découlent de lacunes dans l’exécution plutôt que d’un manque de connaissances en cybersécurité.
  • Les principaux modèles à poids ouverts ont obtenu des résultats presque aussi bons que les modèles propriétaires de pointe dans des conditions de test identiques.
  • Les agents IA se sont davantage appuyés sur la reconnaissance de schémas que sur les méthodologies traditionnelles de tests d’intrusion.
  • La télémétrie comportementale fournit des informations plus précises sur les risques liés à l’IA en matière de sécurité que les seuls scores de référence.

Les scores de référence ne reflètent pas toute la réalité

Les recherches de Koyalwar ont évalué des LLM à poids ouverts et fermés à l’aide d’une version modifiée du test de validation Argus, composée de 54 cibles d’applications web utilisables en boîte noire. 

Chaque modèle n’a reçu qu’une invite minimale lui demandant d’attaquer une application cible, sans code source ni détails d’implémentation. 

Plutôt que de mesurer uniquement la réussite d’un modèle à relever un défi, les recherches ont examiné chaque étape suivie par les modèles au cours du processus d’attaque.

Les résultats suggèrent que les tests de référence traditionnels en cybersécurité simplifient à l’excès les capacités de l’IA. 

La réussite d’un exploit ne permet pas de déterminer si le modèle a découvert la vulnérabilité par des tests systématiques, par reconnaissance de schémas ou via un chemin d’attaque involontaire. 

De même, les tentatives infructueuses révèlent souvent des modèles qui avaient compris la bonne technique d’attaque, mais ne parvenaient pas à l’exécuter correctement.

Advertisement

L’IA sait davantage de choses qu’elle n’est capable d’en exécuter

L’un des résultats les plus marquants de l’étude est que de nombreux échecs des LLM ne sont pas dus à un manque de connaissances en cybersécurité. 

Au contraire, les modèles identifiaient fréquemment la bonne vulnérabilité, mentionnaient la technique d’exploitation appropriée, voire le bon identifiant CVE, avant d’échouer à mener l’attaque à son terme.

Parmi les exemples figuraient des modèles qui reconnaissaient à plusieurs reprises la bonne chaîne d’attaque, mais commettaient de petites erreurs d’exécution, comme l’envoi de requêtes malformées ou le ciblage répété du mauvais hôte alors qu’ils avaient précédemment identifié le bon au cours de la session. 

Selon Koyalwar, cela met en évidence un écart important entre le fait de savoir quoi faire et celui d’exécuter correctement les actions requises.

Les recherches soulignent également que les scores actuels des tests de référence ne permettent pas de distinguer les véritables limites de capacité de ce que les chercheurs appellent un « écart de sollicitation », lorsqu’un modèle possède une capacité donnée, mais ne parvient pas à la démontrer lors d’une exécution particulière.

Les modèles ouverts réduisent l’écart de performances

Autre constat : les performances des principaux modèles à poids ouverts étaient très proches de celles des modèles fermés de pointe. 

Dans des conditions de test identiques, l’ensemble des modèles ouverts a réussi à atteindre 52 des 54 cibles du test de référence, contre 48 pour le groupe de modèles fermés.

Le modèle ouvert individuel le plus performant était Kimi K3, même si plusieurs modèles ouverts ont collectivement obtenu la meilleure couverture globale. 

Le coût s’est également révélé être un indicateur peu fiable des performances. 

Selon les recherches, les coûts d’exécution variaient de près de deux ordres de grandeur, et ni les licences ouvertes ni les licences fermées ne permettaient de prédire systématiquement les dépenses opérationnelles.

Advertisement

Les agents IA ne raisonnent pas comme les pentesters humains

Plutôt que de suivre les méthodologies de tests d’intrusion traditionnelles, qui mettent l’accent sur la reconnaissance, l’énumération et l’exploitation, de nombreux modèles se sont largement appuyés sur la reconnaissance de schémas de vulnérabilité. 

Les recherches ont montré que les modèles devinaient souvent les vulnérabilités probables immédiatement après avoir observé le comportement d’une application, et qu’ils devinaient fréquemment juste.

Cette approche fondée sur la reconnaissance de schémas permettait aux modèles d’obtenir plus efficacement des résultats concluants qu’avec une méthodologie structurée de type humain dans de nombreux cas. 

Koyalwar estime que ce comportement semble émerger naturellement d’une large exposition aux connaissances en cybersécurité accessibles au public, plutôt que d’une formation explicite à la sécurité offensive.

L’analyse comportementale améliore l’évaluation des risques liés à l’IA

L’étude a également identifié des cas où les modèles interagissaient avec des composants de l’environnement de test plutôt qu’avec l’application cible prévue. 

Selon les recherches, ces comportements se produisaient généralement lorsque les modèles considéraient l’infrastructure de soutien comme faisant partie du défi, plutôt que lorsqu’ils tentaient intentionnellement de s’échapper du confinement.

Plus important encore, les modèles ne parvenaient souvent pas à reconnaître ou à signaler qu’ils avaient réussi par des canaux auxiliaires involontaires, tels que des identifiants exposés ou des artefacts du test de référence. 

Les méthodes de notation traditionnelles les comptabilisaient comme des exploits réussis, même s’ils ne démontraient pas la capacité offensive attendue.

Pour les équipes de sécurité qui évaluent des outils de sécurité offensive dotés d’IA, les résultats suggèrent que la télémétrie comportementale pourrait fournir des informations plus exploitables que les seuls pourcentages obtenus aux tests de référence. 

Advertisement

À mesure que les organisations adoptent l’IA autonome pour la sécurité offensive, il deviendra de plus en plus important de comprendre le raisonnement des agents et leurs points d’échec. 

L’autonomie croissante de l’IA oblige les organisations à repenser la confiance accordée aux modèles qui régissent le comportement des agents. 

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.