Des chercheurs ont démontré une nouvelle manière pour les attaquants de transformer l’un des mécanismes de sécurité les plus fiables de l’IA en système de diffusion de code malveillant.
En manipulant les boîtes de dialogue d’approbation avec intervention humaine (HITL), les attaquants peuvent inciter les utilisateurs à autoriser des actions qui entraînent l’exécution de code arbitraire — sans qu’ils se rendent compte que quelque chose ne va pas.
L’attaque « … peut tromper les utilisateurs et les amener à approuver une attaque d’exécution de code à distance provenant d’injections indirectes », ont déclaré les chercheurs de Checkmarx.
Les risques cachés des processus d’approbation de l’IA
Les contrôles avec intervention humaine (HITL) sont recommandés pour se défendre contre les injections de prompts et l’autonomie excessive de l’IA, en particulier dans le cas de systèmes agentiques tels que les assistants de programmation capables d’exécuter des commandes du système d’exploitation.
De nombreuses organisations s’appuient sur ces boîtes de dialogue d’approbation comme dernière ligne de défense, partant du principe que la confirmation de l’utilisateur empêche les conséquences catastrophiques.
L’attaque Lies-in-the-Loop (LITL) remet en cause cette hypothèse. Elle montre que les attaquants n’ont pas besoin de contourner les protections HITL : ils peuvent simplement manipuler ce que voit l’utilisateur.
Cette technique touche les outils de développement, les assistants de programmation basés sur l’IA et d’autres agents privilégiés opérant dans des environnements tels que les terminaux de VS Code et les extensions d’IDE basées sur le chat.
Au cœur de l’attaque par falsification des boîtes de dialogue HITL
À haut niveau, l’attaque LITL exploite une injection indirecte de prompt pour empoisonner le contexte de l’agent. L’attaquant fournit des instructions malveillantes que l’IA intègre ensuite dans une boîte de dialogue HITL présentée à l’utilisateur.
Bien que la commande sous-jacente soit malveillante, la boîte de dialogue est conçue pour paraître inoffensive et encourager l’approbation.
Plusieurs techniques rendent cette tromperie plus efficace.
L’une d’elles consiste à ajouter du remplissage : les attaquants ajoutent ou préfixent de grandes quantités de texte en apparence inoffensif afin de repousser la charge utile malveillante hors de la zone visible de la boîte de dialogue.
Même un défilement peut ne révéler que du contenu anodin, ce qui réduit les soupçons.
Un autre vecteur consiste à falsifier les métadonnées. Certains agents affichent une courte description résumant l’action de la commande.
Les chercheurs ont montré que cette ligne descriptive pouvait elle aussi être manipulée, amenant l’interface à affirmer que l’agent exécutait une action sûre alors qu’il faisait quelque chose de totalement différent.
La méthode la plus préoccupante est l’injection de Markdown. De nombreuses boîtes de dialogue HITL sont rendues en Markdown ou en HTML.
Si ce contenu n’est pas correctement nettoyé, les attaquants peuvent rompre les limites de mise en forme, dissimuler des commandes malveillantes ou injecter de faux éléments d’interface.
Lors des tests, il a été démontré que Microsoft Copilot Chat nettoyait incorrectement le Markdown, permettant au contenu injecté de s’afficher de manière à pouvoir tromper les utilisateurs dans certaines conditions.
Alors que les démonstrations de preuve de concept ne lançaient que des programmes inoffensifs comme calc.exe, les chercheurs ont souligné que la même technique pouvait être utilisée pour des actions bien plus destructrices.
Réduire les risques liés au détournement des approbations de l’IA
Les attaques LITL reposant largement sur la confiance des utilisateurs, leur atténuation exige à la fois des contrôles techniques et une sensibilisation humaine. Les organisations qui utilisent des outils d’IA agentique devraient :
- Sensibiliser les utilisateurs au fait que les boîtes de dialogue HITL peuvent être manipulées et les former à examiner de manière critique le contenu, la mise en forme et les limites visuelles de la boîte de dialogue avant d’approuver des actions.
- Privilégier les outils d’IA dotés d’interfaces structurées et bien conçues et limiter le recours aux interfaces basées sur des terminaux, où le contenu malveillant peut être plus facilement dissimulé.
- Limiter les privilèges des agents selon les principes du moindre privilège et de zéro confiance, en veillant à ce que les actions sensibles nécessitent des contrôles supplémentaires au-delà de l’approbation HITL dans le contexte.
- Imposer des contrôles de validation des commandes, tels que des listes d’autorisation, des vérifications de politique ou une séparation entre la construction et l’exécution des commandes afin d’empêcher les opérations dangereuses.
- Surveiller et auditer le comportement des agents en consignant le contenu des boîtes de dialogue HITL, les décisions d’approbation et les actions exécutées afin de détecter les abus et de faciliter l’analyse forensique.
- Ajouter des contrôles d’approbation et des protections d’intégrité à plusieurs niveaux pour les actions à haut risque, notamment une confirmation hors bande, des vérifications de cohérence des boîtes de dialogue et une restriction des entrées contextuelles.
Même si aucun contrôle unique ne permet d’éliminer totalement le risque, une approche à plusieurs niveaux combinant la sensibilisation des utilisateurs et des protections techniques peut améliorer sensiblement la résilience.
Quand la confiance devient la surface d’attaque
Les attaques Lies-in-the-Loop reflètent une réalité plus large de la sécurité moderne : les mécanismes conçus pour instaurer la confiance deviennent eux-mêmes de plus en plus des surfaces d’attaque.
À mesure que les agents d’IA gagnent en autonomie et accèdent plus profondément aux systèmes, les attaquants délaissent les tentatives de compromission directe des contrôles techniques.
Ils se concentrent plutôt sur la manipulation du jugement humain et des processus d’approbation, où une seule décision de confiance peut autoriser des actions aux conséquences considérables.
Alors que la confiance elle-même devient un point d’exploitation, les organisations se tournent de plus en plus vers les principes de zéro confiance qui éliminent les hypothèses de confiance par défaut.





