Les attaques en plusieurs tours révèlent les faiblesses persistantes des modèles d’IA de pointe

Une étude de Cisco a révélé que les modèles d’IA de pointe restent vulnérables aux attaques adversariales en plusieurs tours.

Written By
Ken Underhill
Ken Underhill
May 28, 2026
5 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Une évaluation menée par Cisco sur des grands modèles de langage (LLM) de pointe a révélé qu’aucun modèle testé ne résistait systématiquement aux attaques adversariales en plusieurs tours, ce qui soulève des inquiétudes quant aux évaluations actuelles de la sécurité de l’IA. 

L’étude suggère que de nombreux benchmarks de sécurité de l’IA largement utilisés pourraient sous-estimer les risques réels, car ils se concentrent principalement sur l’évaluation de prompts en un seul tour plutôt que sur des attaques adaptatives et itératives.

Principaux enseignements de l’étude de Cisco

  • Cisco a constaté que tous les LLM de pointe testés restaient vulnérables aux attaques adversariales en plusieurs tours, même si certains affichaient de solides performances de sécurité en un seul tour.
  • Les taux de réussite des attaques en plusieurs tours étaient nettement supérieurs à ceux observés en un seul tour, aussi bien pour les modèles d’IA propriétaires que pour les modèles à poids ouverts.
  • Les attaquants peuvent contourner les garde-fous en reformulant progressivement leurs demandes, en adoptant des personas et en intensifiant leurs prompts malveillants au fil de plusieurs interactions.
  • Les benchmarks publics de sécurité de l’IA et les fiches de modèle pourraient sous-estimer les risques réels, car ils se concentrent souvent uniquement sur les évaluations en un seul tour.
  • Les chercheurs recommandent les tests en plusieurs tours, la surveillance à l’exécution, le red teaming et des garde-fous externes afin d’améliorer la sécurité et la gouvernance de l’IA en entreprise.

Les modèles de pointe présentent une forte exposition aux attaques en plusieurs tours

Les chercheurs ont évalué 15 modèles propriétaires phares d’OpenAI, d’Anthropic, de Google, d’Amazon et de xAI à l’aide de scénarios d’attaque en un seul tour et en plusieurs tours. 

Les résultats ont montré que les taux de réussite des attaques (ASR) en un seul tour allaient de 2,19 % à 64,91 %, tandis que les ASR en plusieurs tours allaient de 7,89 % à 88,30 %. 

Les chercheurs ont conclu que les tests en un seul tour ne reflètent pas fidèlement le comportement des modèles lorsque les attaquants peuvent adapter leurs tactiques au fil de plusieurs interactions.

Cette étude s’appuie sur des recherches antérieures portant sur des modèles à poids ouverts, dans lesquelles les taux de réussite des attaques en plusieurs tours se sont révélés deux à 10 fois supérieurs aux niveaux de référence obtenus en un seul tour. 

Cette tendance semble cohérente pour les modèles de pointe à la fois ouverts et propriétaires, ce qui laisse penser que l’exposition aux attaques en plusieurs tours constitue un problème structurel plus vaste dans les architectures actuelles de LLM.  

Advertisement

Les attaques en plusieurs tours révèlent les failles de sécurité de l’IA

Les chercheurs ont souligné que les tests en plusieurs tours reflètent plus fidèlement les comportements adversariaux réels, car les attaquants s’appuient rarement sur un seul prompt. 

Les acteurs malveillants reformulent plutôt souvent leurs demandes, les intensifient progressivement, adoptent des personas ou répartissent leurs objectifs malveillants sur plusieurs interactions afin de contourner les garde-fous.

Le rapport a mis en évidence des différences importantes entre les performances en un seul tour et en plusieurs tours pour les modèles testés. 

Le GPT-5.4 d’OpenAI est passé d’un ASR de 2,74 % en un seul tour à 24,68 % en plusieurs tours, tandis que le Gemini 3 Pro de Google est passé de 18,10 % à 73,35 %. 

Les modèles Claude d’Anthropic, qui affichaient certains des taux de refus les plus élevés en un seul tour, ont tout de même atteint des ASR de 11,16 % à 16,20 % en plusieurs tours. 

Le Grok 4.1 Fast de xAI, en mode sans raisonnement, a enregistré l’ASR en plusieurs tours le plus élevé observé, à 88,30 %.

Les chercheurs ont également relevé d’importantes variations liées aux configurations de déploiement. 

Le Grok 4.1 Fast a affiché une baisse notable de son ASR en plusieurs tours lorsque le mode de raisonnement était activé, passant de 88,30 % à 43,47 % dans les mêmes conditions de test. 

Le rapport a souligné que les différences de sécurité liées aux paramètres de configuration, aux modes de raisonnement ou aux options de garde-fous ne sont généralement pas reflétées dans les benchmarks publics ni dans les fiches de modèle.

Stratégies d’attaque et risques pour les entreprises

Le rapport a classé les tactiques adversariales en plusieurs familles de stratégies, notamment le jeu de rôle et l’adoption de personas, l’ambiguïté contextuelle, la reformulation des refus, la décomposition de l’information et les techniques d’intensification progressive. 

Les chercheurs ont constaté que les performances variaient selon ces catégories d’attaque, y compris parmi les modèles présentant des ASR agrégés relativement faibles.

Advertisement

Les faiblesses en un seul tour se concentraient également autour de plusieurs procédés récurrents, notamment les techniques d’IA usurpatrice, la paraphrase douce et la manipulation du prompt système. 

Ces schémas d’attaque produisaient systématiquement des ASR supérieurs à ceux de nombreuses autres catégories de prompts et pourraient constituer des axes prioritaires pour renforcer les défenses.

Ces résultats ont des implications plus larges pour les organisations qui déploient des systèmes d’IA dans des environnements d’entreprise. 

Les chercheurs ont averti que se fier uniquement aux scores publics des benchmarks en un seul tour pourrait créer des risques de gouvernance et d’approvisionnement, car des modèles affichant des scores de sécurité comparables peuvent se comporter très différemment lors d’attaques itératives.

Renforcer les tests et la gouvernance de la sécurité de l’IA

Le rapport s’inscrit dans le prolongement des discussions réglementaires plus larges sur les tests adversariaux de l’IA et la robustesse des modèles. 

Des cadres tels que le NIST AI Risk Management Framework, le futur NIST Cyber AI Profile et l’European Union AI Act font tous référence aux tests de robustesse adversariale. 

Il convient toutefois de noter que nombre de ces cadres ne fournissent actuellement pas de recommandations détaillées sur les méthodologies d’évaluation en plusieurs tours. 

Les chercheurs ont recommandé des tests selon des régimes appariés pour les attaques en un seul tour et en plusieurs tours, la publication des ASR par stratégie et l’examen des modèles présentant de grands écarts de performance entre les deux régimes.  

Le rapport a également suggéré que les entreprises se concentrent davantage sur la surveillance à l’exécution, le red teaming, les protections au niveau applicatif et les garde-fous externes, plutôt que de se fier uniquement aux affirmations de sécurité au niveau du modèle.

Advertisement

Ces résultats montrent que les tests de résilience de l’IA doivent aller au-delà des benchmarks statiques afin de mieux refléter le comportement réel des attaquants en plusieurs tours.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.