OpenAI renforce ChatGPT Atlas contre les attaques par injection de prompt 

OpenAI a mis à jour ChatGPT Atlas pour renforcer ses défenses contre l’injection de prompt.

Written By
Ken Underhill
Ken Underhill
Dec 29, 2025
4 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

OpenAI a déployé une mise à jour de sécurité pour son agent ChatGPT Atlas accessible depuis un navigateur afin de contrer les attaques par injection de prompt. 

La mise à jour introduit de nouvelles défenses au niveau du modèle et du système, conçues pour empêcher des instructions malveillantes dissimulées dans le contenu web de prendre le pas sur l’intention de l’utilisateur.

Un attaquant « … pourrait envoyer un e-mail malveillant pour tromper un agent et l’amener à ignorer la demande de l’utilisateur, puis à transférer des documents fiscaux sensibles vers une adresse e-mail contrôlée par l’attaquant », a déclaré OpenAI à propos des attaques par injection de prompt.

Comprendre l’injection de prompt dans les agents IA

L’injection de prompt désigne des attaques qui exploitent le fait que les agents IA interprètent des instructions en langage naturel provenant de plusieurs sources. 

En dissimulant des instructions adverses dans un contenu apparemment inoffensif — comme un e-mail, un document ou une page web — les attaquants tentent de prendre le pas sur la demande initiale de l’utilisateur et de rediriger le comportement de l’agent.

Comme ChatGPT Atlas peut effectuer bon nombre des mêmes actions qu’un utilisateur dans un navigateur — envoyer des e-mails, accéder à des fichiers dans le cloud ou réaliser des transactions — l’impact potentiel d’une attaque réussie est considérable. 

Contrairement aux attaques web traditionnelles, l’injection de prompt ne repose ni sur des vulnérabilités logicielles ni sur une erreur de l’utilisateur, ce qui la rend plus difficile à détecter et à atténuer avec les contrôles de sécurité traditionnels.

Comment OpenAI utilise le red teaming automatisé

Pour garder une longueur d’avance sur les attaques émergentes, OpenAI a développé un système automatisé de red teaming fondé sur l’apprentissage par renforcement. 

Ce système utilise de grands modèles de langage comme attaquants automatisés et les entraîne à découvrir des techniques sophistiquées d’injection de prompt qui se déploient au fil de workflows longs et comportant plusieurs étapes.

Lorsque le système identifie une nouvelle catégorie d’attaques réussies, il déclenche immédiatement une boucle de réponse rapide. 

OpenAI entraîne de manière adversariale les modèles d’agents mis à jour afin qu’ils résistent aux techniques récemment découvertes, intégrant directement cette résilience au modèle. 

Advertisement

Les traces d’attaque servent également à renforcer la surveillance, les consignes de sécurité et les défenses au niveau du système qui entourent l’agent.

Comment atténuer les risques liés à l’injection de prompt

Réduire le risque d’injection de prompt exige de traiter les agents IA comme des acteurs semi-fiables plutôt que comme des utilisateurs totalement autonomes. 

Outre les garde-fous au niveau du modèle, les organisations devraient appliquer des contrôles opérationnels qui limitent l’autorité des agents, restreignent leur exposition aux entrées non fiables et améliorent la visibilité sur leur comportement. 

  • Limitez l’accès aux comptes connectés et restreignez les autorisations des agents afin que les agents IA disposent de l’autorité minimale requise pour chaque tâche.
  • Utilisez des prompts explicites et strictement circonscrits, et évitez les instructions trop générales qui laissent aux agents une grande latitude pour interpréter du contenu non fiable.
  • Exigez une confirmation renforcée ou une validation secondaire pour les actions sensibles telles que le partage de données, les transactions financières ou les modifications du système.
  • Limitez l’accès des agents à des sites web, outils et ressources précis pour chaque tâche afin de réduire leur exposition aux entrées non fiables ou inutiles.
  • Surveillez et consignez le comportement des agents afin de détecter les dérives d’intention, les actions anormales ou les écarts par rapport à la demande initiale de l’utilisateur.
  • Isolez les agents IA des systèmes centraux et appliquez des limites d’exécution ou de débit afin de réduire le rayon d’impact en cas d’injection de prompt.

Ensemble, ces contrôles contribuent à limiter le rayon d’impact et à réduire le risque d’injection de prompt dans les workflows pilotés par des agents.

Le virage de la sécurité porté par les agents IA

L’injection de prompt met en lumière une évolution plus large de la cybersécurité, à mesure que les systèmes d’IA gagnent en autonomie et s’intègrent toujours davantage aux workflows du quotidien. 

À mesure que les agents acquièrent la capacité d’interpréter du contenu non fiable et d’entreprendre des actions concrètes au nom des utilisateurs, les modèles de sécurité traditionnels fondés sur des autorisations statiques et des contrôles périmétriques deviennent moins efficaces. 

Cette évolution oblige les organisations à repenser la manière dont la confiance, la vérification et la supervision sont appliquées aux systèmes pilotés par l’IA qui opèrent dans des environnements dynamiques. 

En réponse, de nombreuses organisations se tournent vers les principes du zéro trust pour éliminer la confiance implicite et imposer une vérification continue dans les workflows pilotés par l’IA.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.