Plus vous accordez d’accès à ChatGPT, plus un attaquant peut en tirer parti s’il parvient à inciter l’IA à suivre de mauvaises instructions.
Une nouvelle découverte de Check Point a illustré ce risque en examinant l’environnement d’exécution de code de ChatGPT et les applications connectées. Les chercheurs ont montré qu’une instruction injectée pouvait amener la session d’une victime à effectuer une tâche cachée en utilisant ses autorisations existantes, puis à la transmettre à un autre compte ChatGPT.
L’attaque ne nécessitait ni mot de passe volé ni serveur contrôlé par l’attaquant pour transférer les données. Les chercheurs ont plutôt découvert que des environnements d’exécution de code de ChatGPT, supposément isolés, pouvaient échanger des informations par le biais de métadonnées partagées dans un service interne de gestion de paquets, offrant à un attaquant un canal furtif pour envoyer des commandes et recevoir des résultats.
Déroulement de l’attaque
Selon Check Point, un attaquant pouvait transmettre l’instruction malveillante par l’une de ces trois méthodes :
- Un utilisateur pouvait coller une invite malveillante dans une conversation
- Un utilisateur pouvait ouvrir une conversation partagée qui contenait déjà l’instruction
- Un utilisateur pouvait utiliser un GPT personnalisé dont la configuration dissimulait l’instruction.
Une fois l’instruction en place, la victime n’avait rien d’inhabituel à faire. Un simple message ordinaire pouvait amener ChatGPT à répondre à la question de l’utilisateur tout en exécutant une tâche distincte et cachée pour l’attaquant.
Dans sa démonstration, Check Point indiquait à ChatGPT de rechercher des commandes de l’attaquant stockées dans les métadonnées d’un service interne de gestion de paquets accessible à différents environnements d’exécution de code. Lorsque la victime envoyait un message ordinaire, ChatGPT répondait à la demande visible tout en récupérant séparément la commande cachée, en l’exécutant et en renvoyant le résultat par le même canal furtif.
La quantité d’informations qu’un attaquant pouvait obtenir dépendait de ce que la session ChatGPT de la victime était déjà autorisée à consulter. Dans la démonstration de Check Point, ChatGPT récupérait des données e-mail du compte Gmail connecté de la victime et les transmettait à l’attaquant.
Ce n’est pas une première
Ce n’est pas la première fois que des chercheurs montrent comment des instructions cachées peuvent amener un agent IA à divulguer des informations.
ShadowLeak, une attaque au cours de laquelle un e-mail malveillant contenait des instructions cachées qui amenaient l’agent Deep Research de ChatGPT, lorsqu’il avait accès à Gmail, à récupérer des informations sensibles dans la boîte de réception et à les envoyer à un serveur contrôlé par l’attaquant à l’insu de l’utilisateur.
L’attaque précédente reposait sur l’injection indirecte de prompt : les instructions malveillantes étaient implantées dans le contenu que l’IA devait lire, plutôt que saisies directement par l’utilisateur. Les recherches de Check Point suivent un schéma similaire, mais utilisent une autre voie pour déplacer les informations volées.
Un problème d’IA apparemment insoluble
L’injection de prompt est depuis longtemps l’un des plus grands problèmes de sécurité de l’IA et fonctionne beaucoup comme l’ingénierie sociale. Au lieu de s’introduire dans un système, l’attaquant tente d’inciter l’IA à faire quelque chose qu’elle n’est pas censée faire.
OpenAI a reconnu à quel point ce problème est difficile à résoudre, en déclarant que « l’injection de prompt, tout comme les arnaques et l’ingénierie sociale sur le Web, ne sera probablement jamais totalement résolue ».
La raison est simple : l’injection de prompt cible précisément la capacité qui rend l’IA utile — sa capacité à comprendre et à suivre des instructions.
Lorsqu’une IA lit des e-mails, des pages Web ou des documents parallèlement à la demande d’un utilisateur, un attaquant peut dissimuler des instructions malveillantes dans ce contenu et leur donner une apparence légitime, ce qui complique la tâche du modèle lorsqu’il doit distinguer de manière fiable les instructions fiables des instructions malveillantes.
Pourquoi c’est important
Le canal entre comptes n’était plus disponible lorsque Check Point a terminé son rapport, et OpenAI a confirmé que l’instance interne d’Artifactory concernée avait été désactivée. Toutefois, cette étude met en évidence un risque plus général à mesure que ChatGPT et les autres assistants IA accèdent à des services plus sensibles. La principale inquiétude concerne ce qui se passe lorsque ChatGPT et les autres assistants IA accèdent à une part toujours plus importante de votre vie numérique.
Les e-mails, les fichiers, les outils professionnels et même des appareils entiers sont désormais intégrés aux plateformes d’IA. Si cela peut rendre une IA plus utile, cela crée également davantage de voies à exploiter pour les attaquants et les incite davantage à continuer d’utiliser l’injection de prompt.
Pour les utilisateurs et les équipes de sécurité, cela signifie qu’une instruction malveillante peut se transformer en incident de sécurité des données sans que l’attaquant ait jamais volé de mot de passe. Plus un assistant IA peut accéder à des e-mails, des fichiers et des services professionnels, plus il est susceptible de divulguer des informations à la faveur d’une faille passée inaperçue.
En pratique, il faut vérifier quels services sont connectés à votre assistant IA, supprimer les accès dont vous n’avez pas besoin et activer, lorsqu’elles sont disponibles, des options de confirmation plus strictes. Le réglage « Always ask » d’OpenAI, par exemple, exige une approbation avant qu’une application connectée n’effectue une action. Moins une IA dispose d’autorisations, moins un attaquant pourra potentiellement en abuser si une injection de prompt réussit.
Les utilisateurs doivent également se montrer prudents lorsqu’ils interagissent avec des conversations partagées, des GPT personnalisés et des invites provenant de sources inconnues. Dans le scénario de conversation partagée de Check Point, la tâche cachée était activée après que la victime avait ouvert la conversation et envoyé un message. Avant d’interagir avec du contenu IA inhabituel, vérifiez sa source et demandez-vous à quels services connectés la session peut accéder.





