OpenAI renforce ChatGPT Atlas contre les attaques par injection de prompt 

OpenAI a mis à jour ChatGPT Atlas pour renforcer ses défenses contre l’injection de prompt.

Écrit par
Ken Underhill
Ken Underhill
Dec 29, 2025
4 minute read
eSecurity Planet Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

OpenAI a déployé une mise à jour de sécurité pour son agent ChatGPT Atlas accessible depuis un navigateur afin de contrer les attaques par injection de prompt. 

La mise à jour introduit de nouvelles défenses au niveau du modèle et du système, conçues pour empêcher des instructions malveillantes dissimulées dans le contenu web de prendre le pas sur l’intention de l’utilisateur.

Un attaquant « … pourrait envoyer un e-mail malveillant pour tromper un agent et l’amener à ignorer la demande de l’utilisateur, puis à transférer des documents fiscaux sensibles vers une adresse e-mail contrôlée par l’attaquant », a déclaré OpenAI à propos des attaques par injection de prompt.

Comprendre l’injection de prompt dans les agents IA

L’injection de prompt désigne des attaques qui exploitent le fait que les agents IA interprètent des instructions en langage naturel provenant de plusieurs sources. 

En dissimulant des instructions adverses dans un contenu apparemment inoffensif — comme un e-mail, un document ou une page web — les attaquants tentent de prendre le pas sur la demande initiale de l’utilisateur et de rediriger le comportement de l’agent.

Comme ChatGPT Atlas peut effectuer bon nombre des mêmes actions qu’un utilisateur dans un navigateur — envoyer des e-mails, accéder à des fichiers dans le cloud ou réaliser des transactions — l’impact potentiel d’une attaque réussie est considérable. 

Contrairement aux attaques web traditionnelles, l’injection de prompt ne repose ni sur des vulnérabilités logicielles ni sur une erreur de l’utilisateur, ce qui la rend plus difficile à détecter et à atténuer avec les contrôles de sécurité traditionnels.

Comment OpenAI utilise le red teaming automatisé

Pour garder une longueur d’avance sur les attaques émergentes, OpenAI a développé un système automatisé de red teaming fondé sur l’apprentissage par renforcement. 

Ce système utilise de grands modèles de langage comme attaquants automatisés et les entraîne à découvrir des techniques sophistiquées d’injection de prompt qui se déploient au fil de workflows longs et comportant plusieurs étapes.

Lorsque le système identifie une nouvelle catégorie d’attaques réussies, il déclenche immédiatement une boucle de réponse rapide. 

OpenAI entraîne de manière adversariale les modèles d’agents mis à jour afin qu’ils résistent aux techniques récemment découvertes, intégrant directement cette résilience au modèle. 

Advertisement

Les traces d’attaque servent également à renforcer la surveillance, les consignes de sécurité et les défenses au niveau du système qui entourent l’agent.

Comment atténuer les risques liés à l’injection de prompt

Réduire le risque d’injection de prompt exige de traiter les agents IA comme des acteurs semi-fiables plutôt que comme des utilisateurs totalement autonomes. 

Outre les garde-fous au niveau du modèle, les organisations devraient appliquer des contrôles opérationnels qui limitent l’autorité des agents, restreignent leur exposition aux entrées non fiables et améliorent la visibilité sur leur comportement. 

  • Limitez l’accès aux comptes connectés et restreignez les autorisations des agents afin que les agents IA disposent de l’autorité minimale requise pour chaque tâche.
  • Utilisez des prompts explicites et strictement circonscrits, et évitez les instructions trop générales qui laissent aux agents une grande latitude pour interpréter du contenu non fiable.
  • Exigez une confirmation renforcée ou une validation secondaire pour les actions sensibles telles que le partage de données, les transactions financières ou les modifications du système.
  • Limitez l’accès des agents à des sites web, outils et ressources précis pour chaque tâche afin de réduire leur exposition aux entrées non fiables ou inutiles.
  • Surveillez et consignez le comportement des agents afin de détecter les dérives d’intention, les actions anormales ou les écarts par rapport à la demande initiale de l’utilisateur.
  • Isolez les agents IA des systèmes centraux et appliquez des limites d’exécution ou de débit afin de réduire le rayon d’impact en cas d’injection de prompt.

Ensemble, ces contrôles contribuent à limiter le rayon d’impact et à réduire le risque d’injection de prompt dans les workflows pilotés par des agents.

Le virage de la sécurité porté par les agents IA

L’injection de prompt met en lumière une évolution plus large de la cybersécurité, à mesure que les systèmes d’IA gagnent en autonomie et s’intègrent toujours davantage aux workflows du quotidien. 

À mesure que les agents acquièrent la capacité d’interpréter du contenu non fiable et d’entreprendre des actions concrètes au nom des utilisateurs, les modèles de sécurité traditionnels fondés sur des autorisations statiques et des contrôles périmétriques deviennent moins efficaces. 

Cette évolution oblige les organisations à repenser la manière dont la confiance, la vérification et la supervision sont appliquées aux systèmes pilotés par l’IA qui opèrent dans des environnements dynamiques. 

En réponse, de nombreuses organisations se tournent vers les principes du zéro trust pour éliminer la confiance implicite et imposer une vérification continue dans les workflows pilotés par l’IA.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.