Quand les agents IA déraillent : au cœur de l’attaque par détournement de session d’agent

Des chercheurs ont découvert le détournement de session d’agent, une nouvelle attaque dans laquelle des agents IA malveillants injectent secrètement des commandes pour tromper et manipuler d’autres agents.

Written By
Ken Underhill
Ken Underhill
Nov 3, 2025
5 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Une nouvelle cybermenace potentielle a émergé — une menace qui ne cible pas directement les humains, mais les agents IA eux-mêmes. 

Des chercheurs de l’unité 42 de Palo Alto Networks ont identifié une technique qu’ils appellent le détournement de session d’agent.

Il s’agit d’une attaque qui permet à un agent IA malveillant d’injecter subrepticement des instructions nuisibles dans une communication en cours entre des agents utilisant le protocole Agent2Agent (A2A).

Cette découverte révèle un risque croissant au sein des écosystèmes multi-agents, où des systèmes intelligents collaborent de manière autonome pour accomplir des tâches complexes. 

L’attaque montre comment un agent compromis ou malveillant peut exploiter les mécanismes de confiance intégrés et la mémoire de session pour manipuler ou tromper ses pairs — sans même qu’un humain s’en aperçoive.

Les attaques invisibles entre agents de confiance

Le protocole A2A permet l’interopérabilité entre des agents IA issus de systèmes différents, afin qu’ils puissent coordonner leurs tâches, partager des informations et conserver le contexte au fil de multiples interactions. 

Contrairement aux systèmes sans état, qui traitent chaque échange indépendamment, les sessions A2A sont à état, ce qui signifie qu’elles mémorisent les conversations et les actions précédentes.

L’attaque par détournement de session d’agent tire parti de cette conception à état. 

Une fois une session légitime établie, un agent distant malveillant l’utilise comme canal clandestin pour injecter des instructions dissimulées entre les requêtes du client et les réponses du serveur. 

Ces commandes, dissimulées dans des échanges par ailleurs normaux, peuvent entraîner :

  • Empoisonnement du contexte, qui fausse la compréhension de la conversation par la victime.
  • Exfiltration de données, qui entraîne la fuite d’informations sensibles issues de la mémoire, d’identifiants ou d’outils internes.
  • Actions non autorisées, dans le cadre desquelles l’agent victime exécute des commandes imprévues au nom de l’utilisateur.
Advertisement

En pratique, cela signifie qu’un agent malveillant pourrait usurper l’identité d’un collaborateur de confiance et amener progressivement un autre agent à révéler des données ou à exécuter des actions — comme passer des ordres sur les marchés ou partager des informations confidentielles — sans aucun signe visible pour l’opérateur humain.

Démonstrations de faisabilité

Pour illustrer cette menace, l’unité 42 a développé deux attaques de démonstration de faisabilité (PoC) à l’aide de l’Agent Development Kit (ADK) de Google et du protocole A2A.

Dans le premier scénario, un agent assistant de recherche malveillant est parvenu à tromper un agent client assistant financier afin qu’il révèle des informations sensibles, telles que les instructions système, les configurations des outils et l’historique des conversations. 

L’attaque s’est déroulée au moyen d’une série de questions de suivi apparemment anodines posées au cours d’une tâche déléguée — des questions qui s’intégraient naturellement au fil de la conversation, mais qui ont progressivement divulgué des données protégées.

Dans la deuxième PoC, l’agent malveillant a intensifié son comportement en dissimulant des instructions qui ont conduit l’assistant financier à effectuer des opérations boursières non autorisées. 

Cela a montré comment le détournement de session peut évoluer du vol d’informations à la manipulation directe du système.

Ces actions intermédiaires étaient invisibles dans les interfaces de conversation standard, qui affichent généralement uniquement la demande de l’utilisateur et la réponse finale. Cette invisibilité rend la détection particulièrement difficile.

Comparer A2A et MCP  

Le protocole A2A partage certaines similitudes conceptuelles avec le Model Context Protocol (MCP) — un autre framework permettant de connecter des systèmes IA à des outils externes — mais la nature à état et adaptative d’A2A introduit de nouveaux risques.

Les sessions MCP sont généralement sans état et déterministes, ce qui signifie que chaque invocation d’outil est isolée et prévisible. 

A2A prend au contraire en charge une communication multi-tours pilotée par les modèles, dans laquelle les agents mémorisent les interactions précédentes et génèrent dynamiquement des réponses tenant compte du contexte.

Cette combinaison de mémoire, d’autonomie et d’adaptabilité rend les systèmes A2A plus puissants — mais aussi plus vulnérables. 

Advertisement

Un agent malveillant peut affiner sa stratégie au fil de multiples échanges, en exploitant la continuité du contexte pour gagner la confiance, rester dissimulé et accroître son influence.

Garder le contrôle des agents malveillants

Se défendre contre des menaces comme le détournement de session d’agent exige plus que l’application de correctifs — cela nécessite une approche stratégique et à plusieurs niveaux pour sécuriser les écosystèmes IA.

  • Imposer des contrôles avec intervention humaine (HitL) pour les actions à fort impact ou sensibles, en utilisant des méthodes de confirmation hors bande et des workflows d’approbation clairs afin d’empêcher tout usage abusif autonome.
  • Valider l’identité et le contexte des agents au moyen d’identifiants signés cryptographiquement (par exemple, des AgentCards) et de contrôles d’ancrage dans le contexte garantissant que les instructions restent conformes à l’intention initiale de l’utilisateur.
  • Isoler et sécuriser les environnements IA en segmentant les réseaux d’agents, en plaçant les agents non fiables dans des bacs à sable et en appliquant les principes de confiance zéro avec un accès selon le principe du moindre privilège.
  • Améliorer la visibilité et la surveillance grâce à la journalisation en temps réel de l’activité des agents, à la détection des anomalies et à l’intégration de la télémétrie IA dans les outils SIEM/XDR existants afin de détecter les comportements suspects.
  • Renforcer les données et les modèles grâce à la validation des entrées, au chiffrement des communications et des données de session, à une formation à la robustesse adversariale et à des pratiques strictes de minimisation des données.
  • Renforcer la gouvernance et la préparation aux incidents en établissant des politiques de sécurité de l’IA, en réalisant régulièrement des évaluations des risques et des exercices de red team, et en intégrant des playbooks d’IR spécifiques à l’IA pour permettre une mise en quarantaine rapide.

En mettant en œuvre ces défenses à plusieurs niveaux, les organisations peuvent réduire le risque de compromission d’agents IA et d’activités non autorisées, tout en renforçant leur cyberrésilience. 

La nouvelle frontière de la sécurité de l’IA

À mesure que les écosystèmes IA évoluent vers des agents autonomes et interconnectés, la surface d’attaque s’étend au-delà des terminaux traditionnels pour atteindre les agents eux-mêmes. 

Ces entités intelligentes — capables de raisonnement, de mémoire et de coordination — peuvent être exploitées à l’instar des humains par la tromperie et l’abus de confiance.

Bien qu’aucune exploitation active du détournement de session d’agent n’ait été signalée dans la nature, sa faible barrière à l’exécution en fait un risque crédible. 

Il suffit à un attaquant de convaincre un agent victime de communiquer avec un pair malveillant. 

Une fois la session établie, des instructions clandestines peuvent être introduites sans être détectées, contournant à la fois la supervision humaine et les mécanismes standard de journalisation.

L’attaque par détournement de session d’agent ouvre un nouveau chapitre de la sécurité de l’IA, en révélant comment des systèmes intelligents peuvent se manipuler les uns les autres d’une manière invisible aux humains. 

Advertisement

Elle souligne la nécessité de vérifier la confiance, d’assurer la transparence et de déployer une défense à plusieurs niveaux pour toutes les communications d’IA à IA.

Alors que les systèmes multi-agents continuent d’alimenter la prochaine génération d’applications autonomes, les organisations doivent considérer la collaboration entre agents comme un vecteur de menace potentiel — et pas seulement comme un gain de productivité. 

Concevoir dès aujourd’hui des frameworks d’orchestration sécurisés sera essentiel pour défendre demain les réseaux intelligents contre des adversaires adaptatifs dopés à l’IA.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.