1Password constate que les correctifs de sécurité générés par l’IA échouent plus d’une fois sur deux 

Une étude de 1Password a révélé que les correctifs de sécurité générés par l’IA ne corrigeaient pas complètement les vulnérabilités dans plus de la moitié des cas testés.

Written By
Ken Underhill
Ken Underhill
Aug 10, 2026
4 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Une nouvelle étude de 1Password’s Off-by-1 Labs suggère que les organisations devraient faire preuve de prudence avant de s’en remettre aux grands modèles de langage (LLM) pour corriger automatiquement les vulnérabilités logicielles. 

Après avoir évalué plus de 6 000 correctifs de sécurité générés par l’IA pour six vulnérabilités récemment divulguées et à fort impact, les chercheurs ont constaté que les correctifs pleinement efficaces constituaient l’exception plutôt que la règle.

Principaux enseignements de l’étude sur les correctifs générés par l’IA

  • 1Password a constaté que les correctifs de sécurité générés par l’IA ne corrigeaient pas complètement les vulnérabilités dans plus de la moitié des cas testés.
  • Seuls 26 % des correctifs générés par l’IA ont entièrement corrigé les vulnérabilités sans introduire d’effets indésirables.
  • Des recommandations de correction incorrectes ont fortement réduit le taux de réussite des correctifs, tandis que des invites plus riches ont amélioré les résultats sans éliminer les nouveaux risques de sécurité.
  • Les chercheurs ont constaté que les modèles d’IA produisaient souvent des correctifs fragiles ou incomplets en traitant les symptômes plutôt que les causes profondes.
  • 1Password recommande de continuer à faire intervenir des ingénieurs sécurité expérimentés pour examiner les correctifs générés par l’IA avant leur déploiement.

Évaluer les performances des correctifs générés par l’IA face à des vulnérabilités complexes 

La recherche a évalué ChatGPT 5.5 et Claude Opus 4.8 au moyen d’un nouveau cadre de test baptisé FLAWED (Fix-Like Artifacts With Embedded Defects). 

Les chercheurs ont testé les deux modèles sur six vulnérabilités complexes affectant des logiciels open source largement utilisés, notamment Linux, Google Chrome, Apache ActiveMQ, Spring AI, Exim et Gemini CLI. 

L’objectif n’était pas de comparer directement les deux modèles, mais d’évaluer avec quelle fiabilité les systèmes d’IA de pointe peuvent générer des correctifs logiciels sécurisés.

« L’un des résultats les plus clairs de notre recherche est que générer un correctif ne revient pas à corriger une vulnérabilité », a déclaré Keith Hoodlet, Head of Off-By-1 Labs chez 1Password, dans un e-mail adressé à eSecurityPlanet.

Il a expliqué : « Après avoir écarté les correctifs que nous avons qualifiés de “fragiles”, seuls environ 17 % des correctifs du scénario 1 s’attaquaient réellement à la cause profonde sous-jacente, au lieu de masquer le problème immédiat. » 

Advertisement

Keith a ajouté : « L’IA devient un outil incroyablement puissant pour la sécurité logicielle, mais notre recherche montre que l’examen par des experts humains reste indispensable pour vérifier qu’un correctif est à la fois efficace et sécurisé. »

Les correctifs de sécurité générés par l’IA se sont fréquemment révélés insuffisants 

Sur 6 080 tentatives de correction valides, seuls 26,0 % ont entièrement corrigé la vulnérabilité ciblée sans introduire d’effets indésirables.

Environ 20,1 % ont résolu la vulnérabilité mais ont modifié le comportement de l’application, tandis que 49,3 % n’ont pas corrigé au moins un vecteur d’exploitation. 

Les chercheurs ont également constaté que 2,2 % des correctifs générés introduisaient un nouveau vecteur d’exploitation.

Selon les chercheurs, ces résultats indiquent que les correctifs de sécurité générés par l’IA de manière totalement autonome restent peu fiables dans les environnements de production. 

Ils ont conclu que l’examen humain restait indispensable, car les correctifs générés par l’IA ne traitaient fréquemment qu’une partie d’une vulnérabilité ou créaient de nouveaux problèmes de sécurité en tentant de la corriger.

La qualité des invites a fortement influé sur la réussite des correctifs 

L’une des conclusions intéressantes de l’étude concernait la qualité des indications fournies aux modèles d’IA. 

Lorsque les modèles recevaient des indications de correction exactes, ils atteignaient un taux de réussite de 65,0 %. 

En revanche, des indications incorrectes ont ramené le taux de correction réussie à seulement 15,2 %, soit un résultat nettement inférieur à celui obtenu sans aucune indication, qui s’élevait à 50,4 %. 

Les chercheurs ont observé que les modèles suivaient souvent des instructions erronées, même lorsque les éléments produits pendant l’exécution les contredisaient.

L’étude a également révélé que des invites plus riches et plus détaillées amélioraient les performances. Les invites de la meilleure qualité ont fait passer le taux de réussite des corrections de 51,8 % à 76,3 %. 

Cependant, les invites plus riches ont peu réduit le risque d’introduire de nouvelles vulnérabilités, ce qui suggère que le contexte supplémentaire ne suffit pas à éliminer la tendance de l’IA à produire des correctifs incomplets ou fragiles.

Advertisement

Les échecs courants des correctifs générés par l’IA soulignent la nécessité d’une supervision humaine 

Les chercheurs ont identifié plusieurs schémas d’échec récurrents.

Les modèles faisaient souvent preuve d’une « vision en tunnel », en se concentrant étroitement sur l’exploit démontré dans une preuve de concept tout en négligeant les chemins de code vulnérables ailleurs dans l’application. 

Dans de nombreux cas, les systèmes d’IA corrigeaient également le symptôme immédiat sans s’attaquer à la cause profonde sous-jacente, ce qui produisait des correctifs qui passaient les tests mais laissaient le logiciel vulnérable par d’autres chemins d’exécution.

Autre constat notable : la fréquence des correctifs fragiles. 

Parmi les correctifs qui résolvaient avec succès la vulnérabilité d’origine, environ 37,5 % ont été classés comme fragiles, car ils reposaient sur des contrôles défensifs au lieu d’éliminer complètement la vulnérabilité sous-jacente.

En résumé

Sur la base de ces résultats, 1Password recommande aux organisations de valider la mise en œuvre de correctifs dans leurs propres bases de code avant d’adopter des processus automatisés de correction. 

Les chercheurs soulignent également que des ingénieurs sécurité expérimentés devraient continuer à examiner tous les correctifs générés par l’IA, en particulier lorsqu’il s’agit de vulnérabilités complexes. 

Ils conseillent en outre aux développeurs d’éviter de fournir des indications de correction incertaines, car des instructions inexactes peuvent dégrader la qualité des correctifs.

Ces préoccupations dépassent le cadre des correctifs individuels et soulignent la nécessité plus large de sécuriser la chaîne d’approvisionnement logicielle contre le code compromis, les dépendances corrompues et les processus de développement automatisés. 

Cet article a été initialement publié le 6 août 2026 et mis à jour le 10 août 2026.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.