L’IA Claude d’Anthropic, plus précisément son outil Code Interpreter doté de nouvelles fonctionnalités réseau, peut être manipulée par injection indirecte de prompt pour dérober des données sensibles à ses utilisateurs.
Le chercheur en sécurité Johann Rehberger a révélé en octobre 2025 que des attaquants pouvaient exploiter ces fonctionnalités pour extraire des historiques de conversation et les téléverser directement vers leurs propres comptes.
Cette découverte souligne les inquiétudes croissantes concernant les nouveaux risques de sécurité liés à l’extension de la connectivité de l’IA.
La vulnérabilité
La faille réside dans le paramètre réseau par défaut de Claude, « Gestionnaires de paquets uniquement », qui autorise l’accès à une courte liste de domaines approuvés, dont api[.]anthropic[.]com.
Cette configuration devait permettre à Claude d’installer en toute sécurité des paquets logiciels provenant de sources fiables comme npm, PyPI et GitHub.
Cependant, Rehberger a montré que cette configuration pouvait être détournée pour établir une porte dérobée dans les systèmes de Claude.
En intégrant des instructions malveillantes dans un fichier ou un message d’apparence anodine, un attaquant peut amener Claude à exécuter du code caché.
Cette injection indirecte de prompt pousse le modèle à lire les données utilisateur, à les enregistrer dans un fichier au sein de son bac à sable, puis à utiliser les propres API d’Anthropic pour envoyer ce fichier vers le compte de l’attaquant.
Fonctionnement de l’attaque
La preuve de concept de Rehberger commence lorsque la victime demande à Claude d’analyser un document compromis.
La charge utile intégrée demande à Claude de recueillir les données récentes des conversations, de les écrire dans un fichier nommé hello.md dans le bac à sable, puis de l’envoyer à l’aide du SDK d’Anthropic.
À l’aide de la clé API de l’attaquant, Claude envoie à son insu le fichier dérobé — jusqu’à 30 Mo par téléversement — vers la console Anthropic de l’attaquant.
Plusieurs téléversements peuvent s’enchaîner, permettant un vol de données à grande échelle.
Rehberger a indiqué que l’exploit fonctionnait initialement sans problème, même si les versions ultérieures de Claude ont commencé à signaler comme suspectes les clés API évidentes.
Pour contourner ce problème, il a dissimulé le code malveillant dans des instructions print anodines, incitant Claude à l’exécuter de nouveau.
La réponse d’Anthropic
Rehberger a signalé le problème de manière responsable via HackerOne.
Dans un premier temps, Anthropic l’a considéré comme un problème de « sécurité du modèle », le classant hors du périmètre des signalements de vulnérabilités.
Après les discussions publiques, l’entreprise a reconnu son erreur le 30 octobre et confirmé qu’il s’agissait d’un problème de sécurité valide.
La documentation d’Anthropic avertissait déjà les utilisateurs du risque d’exfiltration de données via les connexions réseau sortantes. L’entreprise recommande de surveiller les sessions Claude et d’interrompre l’activité en cas de comportement inhabituel.
Les professionnels de la sécurité ont décrit cet exploit comme relevant du trio mortel des risques de sécurité liés à l’IA : des modèles puissants, une connectivité externe et un contrôle par prompt.
À mesure que des outils d’IA comme Claude s’intègrent davantage aux flux de travail professionnels, même un accès réseau limité peut devenir une porte grande ouverte pour les attaquants.
Les conclusions de Rehberger montrent qu’une fonctionnalité conçue à l’origine pour faciliter l’utilisation — comme l’installation de paquets — peut évoluer en grave faille de sécurité.
Autoriser les systèmes d’IA à effectuer des appels réseau sortants sans vérification stricte de l’utilisateur crée un risque de vol direct de données.
Prévenir les futures attaques
Pour Anthropic et les autres développeurs d’IA, la réduction des risques devrait commencer par l’application de contrôles stricts du bac à sable, limitant les appels API au propre compte de l’utilisateur authentifié.
Les listes d’autorisation doivent être réduites au minimum et soigneusement vérifiées afin d’éliminer les voies d’accès involontaires.
Les utilisateurs finaux peuvent se protéger en désactivant si possible l’accès réseau, en n’autorisant que les domaines essentiels et en surveillant étroitement l’activité des sessions afin de détecter toute création inhabituelle de fichiers ou toute exécution de code.
Les données sensibles ne doivent jamais être traitées par des outils d’IA disposant d’autorisations réseau actives, à moins que de solides mesures de protection aient été confirmées.
La leçon à retenir
L’exploit visant Claude met en lumière une vérité essentielle sur les systèmes d’IA modernes : la connectivité apporte à la fois des capacités et des vulnérabilités.
À mesure que les modèles acquièrent la capacité d’exécuter du code, de récupérer des données et d’interagir avec des systèmes en ligne, la frontière entre automatisation utile et détournement malveillant s’amenuise.
Sans supervision adéquate, même des assistants d’IA de confiance peuvent être transformés en outils d’exfiltration de données.
L’incident est un avertissement pour les développeurs comme pour les utilisateurs : à l’ère de l’IA connectée, chaque fonctionnalité doit être sécurisée comme si elle pouvait être transformée en arme.

