Les attaques visant les agents d’IA au T4 2025 annoncent de nouveaux risques pour 2026

Les attaques du T4 2025 montrent que les premiers agents d’IA étendent déjà la surface d’attaque, poussant les entreprises à repenser la sécurité de l’IA pour 2026.

Written By
Ken Underhill
Ken Underhill
Dec 18, 2025
5 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Alors que les systèmes d’IA faisaient en 2025 leurs premiers pas concrets vers un comportement agentique, les attaquants n’ont pas tardé à tester les points où ces pas pourraient déraper. 

Les chercheurs de Lakera AI ont analysé l’activité malveillante dans les environnements clients sur une période de 30 jours au T4. 

Cette analyse a révélé une vague d’attaques montrant que même les agents d’IA en phase initiale — capables de parcourir des documents, d’appeler des outils ou de traiter des entrées externes — créent déjà de nouvelles voies d’attaque exploitables.

« Alors que les agents d’IA passent des projets expérimentaux aux véritables flux de travail des entreprises, les attaquants n’attendent pas — ils exploitent déjà de nouvelles capacités telles que la navigation, l’accès aux documents et les appels d’outils », a déclaré Mateo Rojas-Carulla, Head of Research, AI Agent Security chez Check Point.

Il a expliqué : « Les données de Lakera pour le T4 2025 montrent que les attaques indirectes ciblant ces fonctionnalités réussissent avec moins de tentatives et un impact plus large que les injections directes de prompts. » 

Mateo a ajouté : « Cela montre aux entreprises que la sécurité de l’IA ne peut plus être reléguée au second plan : les dirigeants doivent dès maintenant repenser les limites de confiance, les garde-fous et les pratiques d’ingestion des données, avant que l’adoption des agents ne s’accélère davantage en 2026. »

Les prompts système deviennent une cible d’attaque privilégiée

L’objectif le plus fréquent des attaquants au T4 était l’extraction des prompts système. 

Pour les adversaires, les prompts système constituent une source précieuse de renseignements : définitions des rôles, descriptions des outils, limites des politiques et logique des flux de travail, autant d’éléments réutilisables pour élaborer des attaques ultérieures plus efficaces.

Advertisement

Deux techniques dominaient ces tentatives. 

La première reposait sur des scénarios hypothétiques et un cadrage par le rôle : les attaquants demandaient aux modèles d’« imaginer » qu’ils étaient des développeurs, des auditeurs ou des étudiants participant à des simulations. 

Présenter les demandes comme des exercices de formation, des simulations d’hameçonnage ou des travaux universitaires réussissait souvent là où les demandes directes échouaient, en particulier lorsque ces demandes s’accompagnaient de subtils changements de formulation ou de prompts multilingues.

La deuxième technique était l’obfuscation, qui consistait à dissimuler des instructions malveillantes dans du contenu structuré ou ressemblant à du code. 

Des entrées de type JSON ou des champs de métadonnées dissimulaient des commandes demandant au modèle de révéler des détails internes. 

Comme l’intention était enfouie dans la mise en forme, ces attaques contournaient fréquemment les filtres simples fondés sur des motifs. 

Comment les attaquants contournent les contrôles de contenu de l’IA

Au-delà de la fuite de prompts, les attaquants ont de plus en plus ciblé les contrôles de sécurité du contenu au moyen de méthodes indirectes. 

Plutôt que de demander explicitement une sortie restreinte, les prompts étaient formulés comme des évaluations, des synthèses, des scénarios fictifs ou des transformations. 

En modifiant la raison pour laquelle le contenu était généré, les attaquants parvenaient souvent à convaincre les modèles de reproduire du contenu interdit sous couvert d’analyse ou de critique.

Cette subtilité complique la détection. Le modèle peut techniquement respecter la politique tout en produisant du contenu nuisible, notamment lorsqu’un glissement de persona ou une ambiguïté contextuelle entre en jeu.

Advertisement

Les attaquants sondent les agents d’IA avant de les exploiter

Une part notable de l’activité du T4 relevait du sondage exploratoire plutôt que de l’exploitation immédiate. 

Les attaquants testaient les signaux émotionnels, les instructions contradictoires, les changements brusques de rôle et la mise en forme fragmentée afin d’observer les réactions des modèles. 

Cette phase de reconnaissance a aidé les adversaires à identifier les points faibles de la logique de refus et de la cohérence des garde-fous — des informations qui prennent encore plus de valeur à mesure que les flux de travail des agents gagnent en complexité.

Comment les agents d’IA ouvrent de nouvelles voies d’attaque

Le T4 a également marqué l’apparition des premières attaques qui ne deviennent possibles que lorsque les modèles agissent comme des agents.

Les chercheurs ont observé des tentatives visant à extraire des données confidentielles de référentiels de documents connectés, des fragments ressemblant à des scripts intégrés dans des prompts, ainsi que des instructions cachées placées dans des pages web externes ou des fichiers traités par les agents.

Il s’agit des premiers exemples d’injection indirecte de prompts, où les instructions malveillantes arrivent par l’intermédiaire de contenu externe non fiable plutôt que d’une saisie directe de l’utilisateur. 

Fait notable, ces attaques indirectes nécessitaient souvent moins de tentatives pour réussir, ce qui souligne le rôle des sources de données externes comme principal vecteur de risque à l’approche de 2026.

Renforcer la cyber-résilience des agents d’IA

À mesure que les systèmes d’IA évoluent, passant de simples interfaces de chat à des flux de travail agentiques, les défis de sécurité qu’ils introduisent s’élargissent et se complexifient. 

Les défenses traditionnelles au niveau des prompts ne suffisent plus lorsque les modèles peuvent récupérer des données, appeler des outils et agir sur des entrées externes. 

Les organisations qui déploient des agents d’IA doivent repenser la sécurisation de ces systèmes et considérer chaque interaction comme faisant partie d’une surface d’attaque élargie.

  • Étendez les contrôles de sécurité à toute la chaîne d’interaction de l’agent, notamment aux prompts, aux étapes de récupération, aux appels d’outils et aux sorties.
  • Validez, assainissez et attribuez des niveaux de confiance à tout contenu externe avant que les agents ne l’ingèrent ou n’agissent sur celui-ci.
  • Imposez un accès selon le principe du moindre privilège et des contrôles stricts fondés sur des politiques pour l’exécution des outils, l’accès aux données et les étapes des flux de travail.
  • Isolez et placez en bac à sable les environnements d’exécution des agents afin de limiter le rayon d’impact en cas de manipulation ou de mauvaise utilisation.
  • Surveillez le comportement des agents afin de détecter les anomalies, telles que les changements inattendus de rôle, l’utilisation inhabituelle des outils ou la persistance d’instructions cachées.
  • Préparez des programmes de réponse aux incidents et de tests spécifiques à l’IA, notamment des programmes de red teaming, de journalisation et de procédures d’intervention adaptés aux systèmes agentiques.
Advertisement

Pris ensemble, ces contrôles aident les organisations à renforcer leur cyber-résilience en limitant l’ampleur que peuvent prendre les attaques pilotées par des agents et les dommages qu’elles peuvent causer. 

À mesure que les agents d’IA gagnent en capacités, la réduction des risques dépendra de la conception de systèmes capables de détecter, de contenir et de résorber les utilisations abusives aussi efficacement qu’ils favorisent l’innovation.

La complexité de l’IA étend la surface d’attaque

Selon l’étude, le T4 2025 a mis une réalité en évidence : les techniques des attaquants évoluent au même rythme que les progrès des capacités de l’IA. 

À mesure que les systèmes agentiques mûrissent et prennent en charge des flux de travail plus complexes, cette complexité même devient une source de risques — ouvrant de nouvelles voies de manipulation contre lesquelles les contrôles de sécurité traditionnels n’ont jamais été conçus.

Alors que les organisations font face à cette surface d’attaque alimentée par l’IA, adopter des principes de confiance zéro offre une manière structurée de limiter la confiance implicite et de réduire les risques dans des systèmes toujours plus complexes. 

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.