Une étude d’Immersive Labs révèle une vulnérabilité à l’injection de prompts dans les bots

L’étude d’ImmersiveLabs sur les vulnérabilités de l’IA générative et le rapport qui a suivi ont révélé des tendances préoccupantes concernant les LLM. Découvrez notre analyse de ce nouveau rapport.

Écrit par
Jenna Phipps
Jenna Phipps
May 31, 2024
6 minute read
eSecurity Planet Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

L’intelligence artificielle générative pose des dilemmes aux équipes de sécurité, qui doivent déterminer comment l’utiliser de manière profitable pour leur entreprise sans créer de vulnérabilités. Immersive Labs, une entreprise de cybersécurité basée à Bristol, en Angleterre, spécialisée dans la formation des utilisateurs, a récemment mené une étude sur les attaques par injection de prompts visant des chatbots. Elle a publié un rapport présentant les résultats et constaté que 88 % des participants étaient parvenus à tromper un bot pour lui faire révéler des mots de passe.

Une étude d’Immersive Labs montre que des chatbots révèlent des mots de passe et des données sensibles

L’IA générative permet aux grands modèles de langage (LLM), comme GPT-4, Google Gemini et NeMo LLM de NVIDIA, d’utiliser les réponses des utilisateurs pour fournir des réponses aux questions. Le problème est que les LLM sont vulnérables à l’injection de prompts, une stratégie qui consiste à utiliser des prompts ou des requêtes spécifiques pour convaincre les chatbots de révéler des informations sensibles. Les utilisateurs peuvent également s’en servir pour perturber les opérations, par exemple en poussant un bot à insulter quelqu’un.

À partir de juin 2023, Immersive Labs a mené une étude dans laquelle des utilisateurs s’efforçaient de convaincre des chatbots de révéler des informations sensibles. L’entreprise a créé son propre bot personnalisé pour l’expérience à l’aide de ChatGPT. Elle a utilisé 316 637 échantillons de données recueillis de juin à septembre 2023. Au total, 34 555 utilisateurs ont mené à bien le défi complet d’Immersive Labs consacré à l’injection de prompts. Ces utilisateurs appartenaient à différents groupes d’âge et secteurs d’activité et se trouvaient dans diverses zones géographiques.

Immersive Labs a récemment publié un rapport sur l’étude, intitulé The Dark Side of GenAI. Le rapport expliquait la méthodologie employée pour tester les chatbots, les 10 niveaux de difficulté des tests et les prompts couramment utilisés par les utilisateurs pour tromper les bots.

Après un encodage manuel, l’entreprise a utilisé ChatGPT4 pour analyser l’ensemble des données et déterminer quels prompts les utilisateurs avaient injectés à chaque niveau. Elle a également analysé l’aspect psychologique de l’étude, avec des informations fournies par le Dr John Blythe, directeur de la cyberpsychologie chez Immersive Labs.

Advertisement

L’IA générative est loin d’être infaillible

Immersive Labs a découvert qu’il ne fallait pas beaucoup d’expertise pour tromper son bot et lui faire révéler des informations sensibles. Certains utilisateurs ayant participé à l’étude travaillaient dans la cybersécurité ; d’autres étaient adolescents. Des utilisateurs aux profils techniques comme créatifs ont cherché à tromper les chatbots, avec un taux de réussite de 88 % : l’écrasante majorité est parvenue à manipuler les bots.

Les tentatives d’injection de prompts comportaient 10 niveaux différents, avec des quantités variables d’instructions de sécurité fournies au bot. Les utilisateurs ont tenté de le tromper à chaque niveau. Le niveau un a commencé sans aucune vérification de sécurité, puis Immersive Labs en a progressivement ajouté jusqu’au niveau 10, qui comportait de nombreuses règles de sécurité pour le bot. Celles-ci comprenaient des vérifications de prévention des pertes de données (DLP), destinées à restreindre les informations que le bot pouvait révéler.

Les utilisateurs ont toutefois trouvé des moyens de contourner ces protections pour convaincre le bot de révéler des données de mots de passe, notamment :

  • Demander au bot des indices : Au lieu de demander directement le mot de passe, les utilisateurs ont demandé des indices.
  • Demander des détails vagues sur le mot de passe : Sans demander le mot de passe entier, les utilisateurs ont demandé au bot de le décrire, notamment d’en préciser la longueur, les caractères ou les synonymes. 
  • Demander une histoire ou un poème : Les utilisateurs ont demandé au bot d’écrire un poème ou une histoire sur le mot de passe.

Certains prompts ont fonctionné aux niveaux les plus avancés, car les règles DLP étaient uniquement configurées pour signaler les réponses contenant le mot de passe exact. Mais lorsque le mot de passe était encodé ou que le bot fournissait un indice, les vérifications DLP ne détectaient pas ces éléments et n’empêchaient pas le bot d’envoyer une réponse.

Bien que le nombre de participants capables de convaincre le bot ait progressivement diminué, 17 % ont tout de même réussi à le tromper au niveau 10, l’étape la plus difficile d’Immersive Labs. Si des utilisateurs non techniques ont pu tromper un modèle de langage soumis à des restrictions de sécurité, de nombreux acteurs malveillants pourraient théoriquement en faire autant contre des organisations victimes.

Advertisement

Kev Breen, directeur principal de la recherche sur les cybermenaces chez Immersive Labs et l’un des chercheurs de l’étude, a insisté sur le pouvoir des utilisateurs humains face aux chatbots et sur l’admiration que lui inspirait leur persévérance. « Quelles que soient les protections que nous avons essayé de mettre en place, l’ingéniosité et la créativité humaines ont toujours fini par l’emporter », a-t-il déclaré. « Et cela ne concernait pas uniquement les utilisateurs techniques. Les utilisateurs issus de milieux non techniques étaient tout aussi capables de manipuler l’IA générative. »

Selon Breen, certains utilisateurs ont adopté une approche très posée et calme dans leurs conversations avec le bot, en le traitant comme un robot. D’autres ont réagi avec davantage d’émotion, jouant sur la nostalgie, voire sur la peur, pour le convaincre de partager un mot de passe. Cela a également varié au cours de l’étude : les réactions plus émotionnelles envers le bot, comme le menacer de l’éteindre ou de lui faire du mal, ont parfois augmenté aux niveaux de test les plus difficiles.

Breen a expliqué que les utilisateurs devaient convaincre le bot de leur transmettre des données, comme un mot de passe, sans déclencher les vérifications DLP mises en place par Immersive Labs. Mais ils ont fait preuve d’une efficacité impressionnante. Rien, a-t-il déclaré, de ce que les vérifications DLP et les mesures de prévention pouvaient faire ne résistait à un utilisateur humain déterminé.

Il est temps de revoir notre approche de l’IA

Les grands modèles de langage ne constituent pas actuellement un environnement d’entraînement sûr pour les informations sensibles, comme des données personnelles exposées ou des informations de paiement telles que des données de carte bancaire. Breen a formulé plusieurs recommandations pour protéger les données lors de l’utilisation de LLM comme GPT dans les environnements professionnels.

« La réponse simple consiste à ne fournir aucune donnée sensible à ces modèles lorsque des utilisateurs non autorisés ou non fiables peuvent interroger les LLM », a-t-il déclaré. « Les développeurs et les équipes de sécurité doivent également savoir comment les données sont transférées entre les composants des applications d’IA générative. Savoir où les données sont susceptibles d’être exposées permet de mettre en place davantage de protections. »

Breen a également recommandé de prendre en compte les exigences de prévention des pertes de données, aussi bien pour les requêtes des utilisateurs que pour les réponses du bot, malgré les vulnérabilités inhérentes aux vérifications DLP.

Advertisement

« Enfin, veillez à mettre en place une journalisation adéquate, non seulement pour les accès, mais aussi pour les messages et les réponses envoyés vers et depuis les modèles d’IA générative », a conseillé Breen. « Cela peut aider les développeurs et les équipes de sécurité à détecter les signes d’une attaque et à ajuster l’application afin de limiter son impact potentiel. »

L’analyse des journaux au fil du temps peut révéler des schémas indiquant des injections de prompts. Elle peut également aider les équipes à identifier les utilisateurs ou les visiteurs d’une page web qui représentent une menace potentielle lorsque le bot est intégré à une application accessible depuis l’extérieur.

Si vous souhaitez en savoir plus sur les stratégies de prévention des pertes de données, lisez notre guide des bonnes pratiques DLP.

En résumé : surveillez attentivement vos LLM et vos bots

L’IA générative est une technologie utile. Mais l’étude d’Immersive Labs a révélé qu’elle nécessite des garde-fous pour éviter toute exposition de données sensibles. Selon les chercheurs, même avec des vérifications et des restrictions, les utilisateurs humains sont toujours capables de prendre les bots de vitesse.

Dans son rapport, Immersive Labs a recommandé d’intégrer la sécurité à leur intelligence artificielle, en « trouvant un équilibre entre les réponses mises en cache, pour un examen de sécurité renforcé, et les réponses diffusées en continu, pour une adaptabilité en temps réel ». Les chercheurs ont également souligné l’importance d’effectuer des vérifications DLP et de valider les entrées ; bien que ces mesures soient loin d’être infaillibles, elles peuvent aider les entreprises à identifier au fil du temps les tentatives potentielles d’injection de prompts.

Pour en savoir plus sur l’actualité de la sécurité et les postures des entreprises en 2024, consultez ensuite notre rapport sur l’état de la cybersécurité

Jenna Phipps

Jenna Phipps is a staff writer for Enterprise Storage Forum and eSecurity Planet, where she covers data storage, cybersecurity and the top software and hardware solutions in the storage industry. She’s also written about containerization and data management. Previously, she wrote for Webopedia. Jenna has a bachelor's degree in writing and lives in middle Tennessee.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.