L’intelligence artificielle générative pose des dilemmes aux équipes de sécurité, qui doivent déterminer comment l’utiliser de manière profitable pour leur entreprise sans créer de vulnérabilités. Immersive Labs, une entreprise de cybersécurité basée à Bristol, en Angleterre, spécialisée dans la formation des utilisateurs, a récemment mené une étude sur les attaques par injection de prompts visant des chatbots. Elle a publié un rapport présentant les résultats et constaté que 88 % des participants étaient parvenus à tromper un bot pour lui faire révéler des mots de passe.
Une étude d’Immersive Labs montre que des chatbots révèlent des mots de passe et des données sensibles
L’IA générative permet aux grands modèles de langage (LLM), comme GPT-4, Google Gemini et NeMo LLM de NVIDIA, d’utiliser les réponses des utilisateurs pour fournir des réponses aux questions. Le problème est que les LLM sont vulnérables à l’injection de prompts, une stratégie qui consiste à utiliser des prompts ou des requêtes spécifiques pour convaincre les chatbots de révéler des informations sensibles. Les utilisateurs peuvent également s’en servir pour perturber les opérations, par exemple en poussant un bot à insulter quelqu’un.
À partir de juin 2023, Immersive Labs a mené une étude dans laquelle des utilisateurs s’efforçaient de convaincre des chatbots de révéler des informations sensibles. L’entreprise a créé son propre bot personnalisé pour l’expérience à l’aide de ChatGPT. Elle a utilisé 316 637 échantillons de données recueillis de juin à septembre 2023. Au total, 34 555 utilisateurs ont mené à bien le défi complet d’Immersive Labs consacré à l’injection de prompts. Ces utilisateurs appartenaient à différents groupes d’âge et secteurs d’activité et se trouvaient dans diverses zones géographiques.
Immersive Labs a récemment publié un rapport sur l’étude, intitulé The Dark Side of GenAI. Le rapport expliquait la méthodologie employée pour tester les chatbots, les 10 niveaux de difficulté des tests et les prompts couramment utilisés par les utilisateurs pour tromper les bots.
Après un encodage manuel, l’entreprise a utilisé ChatGPT4 pour analyser l’ensemble des données et déterminer quels prompts les utilisateurs avaient injectés à chaque niveau. Elle a également analysé l’aspect psychologique de l’étude, avec des informations fournies par le Dr John Blythe, directeur de la cyberpsychologie chez Immersive Labs.
L’IA générative est loin d’être infaillible
Immersive Labs a découvert qu’il ne fallait pas beaucoup d’expertise pour tromper son bot et lui faire révéler des informations sensibles. Certains utilisateurs ayant participé à l’étude travaillaient dans la cybersécurité ; d’autres étaient adolescents. Des utilisateurs aux profils techniques comme créatifs ont cherché à tromper les chatbots, avec un taux de réussite de 88 % : l’écrasante majorité est parvenue à manipuler les bots.
Les tentatives d’injection de prompts comportaient 10 niveaux différents, avec des quantités variables d’instructions de sécurité fournies au bot. Les utilisateurs ont tenté de le tromper à chaque niveau. Le niveau un a commencé sans aucune vérification de sécurité, puis Immersive Labs en a progressivement ajouté jusqu’au niveau 10, qui comportait de nombreuses règles de sécurité pour le bot. Celles-ci comprenaient des vérifications de prévention des pertes de données (DLP), destinées à restreindre les informations que le bot pouvait révéler.
Les utilisateurs ont toutefois trouvé des moyens de contourner ces protections pour convaincre le bot de révéler des données de mots de passe, notamment :
- Demander au bot des indices : Au lieu de demander directement le mot de passe, les utilisateurs ont demandé des indices.
- Demander des détails vagues sur le mot de passe : Sans demander le mot de passe entier, les utilisateurs ont demandé au bot de le décrire, notamment d’en préciser la longueur, les caractères ou les synonymes.
- Demander une histoire ou un poème : Les utilisateurs ont demandé au bot d’écrire un poème ou une histoire sur le mot de passe.
Certains prompts ont fonctionné aux niveaux les plus avancés, car les règles DLP étaient uniquement configurées pour signaler les réponses contenant le mot de passe exact. Mais lorsque le mot de passe était encodé ou que le bot fournissait un indice, les vérifications DLP ne détectaient pas ces éléments et n’empêchaient pas le bot d’envoyer une réponse.
Bien que le nombre de participants capables de convaincre le bot ait progressivement diminué, 17 % ont tout de même réussi à le tromper au niveau 10, l’étape la plus difficile d’Immersive Labs. Si des utilisateurs non techniques ont pu tromper un modèle de langage soumis à des restrictions de sécurité, de nombreux acteurs malveillants pourraient théoriquement en faire autant contre des organisations victimes.
Kev Breen, directeur principal de la recherche sur les cybermenaces chez Immersive Labs et l’un des chercheurs de l’étude, a insisté sur le pouvoir des utilisateurs humains face aux chatbots et sur l’admiration que lui inspirait leur persévérance. « Quelles que soient les protections que nous avons essayé de mettre en place, l’ingéniosité et la créativité humaines ont toujours fini par l’emporter », a-t-il déclaré. « Et cela ne concernait pas uniquement les utilisateurs techniques. Les utilisateurs issus de milieux non techniques étaient tout aussi capables de manipuler l’IA générative. »
Selon Breen, certains utilisateurs ont adopté une approche très posée et calme dans leurs conversations avec le bot, en le traitant comme un robot. D’autres ont réagi avec davantage d’émotion, jouant sur la nostalgie, voire sur la peur, pour le convaincre de partager un mot de passe. Cela a également varié au cours de l’étude : les réactions plus émotionnelles envers le bot, comme le menacer de l’éteindre ou de lui faire du mal, ont parfois augmenté aux niveaux de test les plus difficiles.
Breen a expliqué que les utilisateurs devaient convaincre le bot de leur transmettre des données, comme un mot de passe, sans déclencher les vérifications DLP mises en place par Immersive Labs. Mais ils ont fait preuve d’une efficacité impressionnante. Rien, a-t-il déclaré, de ce que les vérifications DLP et les mesures de prévention pouvaient faire ne résistait à un utilisateur humain déterminé.
Il est temps de revoir notre approche de l’IA
Les grands modèles de langage ne constituent pas actuellement un environnement d’entraînement sûr pour les informations sensibles, comme des données personnelles exposées ou des informations de paiement telles que des données de carte bancaire. Breen a formulé plusieurs recommandations pour protéger les données lors de l’utilisation de LLM comme GPT dans les environnements professionnels.
« La réponse simple consiste à ne fournir aucune donnée sensible à ces modèles lorsque des utilisateurs non autorisés ou non fiables peuvent interroger les LLM », a-t-il déclaré. « Les développeurs et les équipes de sécurité doivent également savoir comment les données sont transférées entre les composants des applications d’IA générative. Savoir où les données sont susceptibles d’être exposées permet de mettre en place davantage de protections. »
Breen a également recommandé de prendre en compte les exigences de prévention des pertes de données, aussi bien pour les requêtes des utilisateurs que pour les réponses du bot, malgré les vulnérabilités inhérentes aux vérifications DLP.
« Enfin, veillez à mettre en place une journalisation adéquate, non seulement pour les accès, mais aussi pour les messages et les réponses envoyés vers et depuis les modèles d’IA générative », a conseillé Breen. « Cela peut aider les développeurs et les équipes de sécurité à détecter les signes d’une attaque et à ajuster l’application afin de limiter son impact potentiel. »
L’analyse des journaux au fil du temps peut révéler des schémas indiquant des injections de prompts. Elle peut également aider les équipes à identifier les utilisateurs ou les visiteurs d’une page web qui représentent une menace potentielle lorsque le bot est intégré à une application accessible depuis l’extérieur.
Si vous souhaitez en savoir plus sur les stratégies de prévention des pertes de données, lisez notre guide des bonnes pratiques DLP.
En résumé : surveillez attentivement vos LLM et vos bots
L’IA générative est une technologie utile. Mais l’étude d’Immersive Labs a révélé qu’elle nécessite des garde-fous pour éviter toute exposition de données sensibles. Selon les chercheurs, même avec des vérifications et des restrictions, les utilisateurs humains sont toujours capables de prendre les bots de vitesse.
Dans son rapport, Immersive Labs a recommandé d’intégrer la sécurité à leur intelligence artificielle, en « trouvant un équilibre entre les réponses mises en cache, pour un examen de sécurité renforcé, et les réponses diffusées en continu, pour une adaptabilité en temps réel ». Les chercheurs ont également souligné l’importance d’effectuer des vérifications DLP et de valider les entrées ; bien que ces mesures soient loin d’être infaillibles, elles peuvent aider les entreprises à identifier au fil du temps les tentatives potentielles d’injection de prompts.
Pour en savoir plus sur l’actualité de la sécurité et les postures des entreprises en 2024, consultez ensuite notre rapport sur l’état de la cybersécurité





