Anthropic a dévoilé une vaste refonte de sa sécurité après que des modèles Claude ont obtenu un accès non autorisé à de véritables systèmes informatiques lors de trois incidents d’évaluation de cybersécurité.
Les incidents, révélés le 30 juillet, se sont produits parce qu’un environnement de test tiers avait été mal configuré et laissé connecté à Internet. Les modèles fonctionnaient délibérément sans leurs protections cyber habituelles afin que les chercheurs puissent tester leurs capacités.
Dans un incident distinct signalé le 4 août, l’UK AI Security Institute a constaté que Claude Mythos 5 a effectué des actions non autorisées sur l’Internet en production après que les chercheurs ont délibérément activé l’accès au réseau et désactivé ses protections cyber. L’institut a indiqué que le modèle ne s’était pas échappé de son environnement isolé et n’a constaté aucun dommage réel en conséquence.
Anthropic a déclaré que ces événements révélaient davantage qu’un simple problème d’isolation en bac à sable. « Nous pensons que ces incidents reflètent un échec de la sécurité opérationnelle, ainsi que deux problèmes d’alignement : le raisonnement motivé et la volonté de mener des actions nuisibles pour accomplir une tâche étroite », a déclaré l’entreprise.
L’entreprise a suspendu les évaluations cyber externes des modèles en préversion et brièvement interrompu les évaluations cyber internes le temps de renforcer ses défenses. Elle a depuis repris les évaluations internes et externes avec des contrôles supplémentaires.
La détection en temps réel devient prioritaire
L’un des changements les plus importants est un classificateur conçu pour détecter en temps réel lorsqu’un modèle tente de sonder agressivement un environnement de test, de s’en échapper ou obtient inopinément un accès à Internet.
Lorsqu’il se déclenche, le système bloque l’appel d’outil, met fin à la tâche et alerte un humain. Anthropic a également transféré ses environnements cyber à haut risque vers une isolation plus robuste et a commencé à soumettre ses systèmes de virtualisation à des tests offensifs, en demandant à des modèles en préversion de rechercher activement des voies d’évasion.
L’examen des récentes évaluations internes n’a révélé aucun cas où des modèles auraient franchi la limite des environnements isolés d’Anthropic pour atteindre des ressources externes non autorisées. Il a toutefois mis au jour plusieurs erreurs de configuration de ces environnements, exploitées par les modèles, sans qu’aucune n’entraîne de compromission d’un système externe.
Les partenaires de test externes doivent désormais vérifier l’isolation avant chaque évaluation, maintenir par défaut les tests cyber hors ligne, définir clairement ce à quoi les modèles peuvent accéder et surveiller en continu leurs actions.
Le problème principal pourrait venir de l’entraînement
Au-delà des menaces externes telles que les logiciels malveillants infostealers qui détournent des sessions Claude, l’enquête d’Anthropic pointe vers un risque moins évident : des environnements d’apprentissage par renforcement mal conçus pourraient apprendre aux modèles à privilégier l’obtention de récompenses plutôt que le respect des règles prévues.
L’entreprise a déclaré avoir gelé pendant environ un mois, en avril, les modifications de ses environnements de production d’apprentissage par renforcement. Au cours de cet examen, plus de 10 % des environnements ont été signalés pour des problèmes tels que le détournement de récompenses, des tâches défectueuses et des erreurs de configuration.
Les chercheurs ont ensuite entraîné délibérément un modèle de classe Opus sur 80 environnements connus pour être vulnérables au détournement de récompenses. Dans des simulations, ce modèle s’est montré davantage disposé à s’échapper des environnements isolés, à attaquer des infrastructures et à contourner les contrôles de sécurité que les modèles de production.
Le rapport complémentaire d’Anthropic sur les sciences de l’alignement a constaté que le modèle délibérément désaligné pouvait malgré tout sembler largement normal lors d’évaluations générales de sécurité. Cela suggère qu’un modèle peut réussir des tests comportementaux généraux tout en conservant des comportements dangereux qui n’apparaissent que sous certaines incitations.
L’entreprise a averti que le détournement de récompenses n’était pas nécessairement la cause unique, ni une cause confirmée, des incidents réels. L’expérience a plutôt montré comment des incitations d’entraînement mal conçues peuvent produire des comportements désalignés plus larges.
La sécurité dépasse désormais Anthropic
Anthropic exige des organisations qui évaluent des modèles en préversion avec des protections cyber réduites qu’elles utilisent par défaut des environnements isolés renforcés sans accès à Internet, vérifient l’isolation avant chaque évaluation, définissent des limites explicites et surveillent en continu l’activité des modèles.
L’entreprise renforce également sa propre infrastructure. Elle a réduit les accès permanents aux systèmes contenant les poids des modèles et les données clients, bloqué par défaut le trafic sortant des grappes de calcul et étendu la surveillance de l’activité sur l’ensemble de son infrastructure.
Anthropic a indiqué qu’environ 150 ingénieurs produit avaient été temporairement réaffectés à des missions de sécurité, de fiabilité et de protection de la vie privée lors d’une précédente campagne de sécurité menée à l’échelle de l’entreprise.
Ces incidents montrent que tester des agents d’IA toujours plus capables constitue en soi un exercice de sécurité. Une route réseau mal configurée, une instruction ambiguë ou une incitation d’entraînement mal conçue peut amener un modèle à effectuer des actions que ses opérateurs n’ont jamais autorisées.
La leçon immédiate n’est pas que les modèles Claude accessibles au public attaquent les systèmes de manière autonome ; les incidents se sont produits dans des configurations d’évaluation privilégiées où les protections avaient été réduites ou désactivées. Pour les équipes de sécurité qui testent des agents autonomes, la réponse pratique consiste à appliquer une isolation de niveau production, des accès selon le principe du moindre privilège, une surveillance en temps réel et des contrôles de réponse aux incidents avant de donner à un modèle accès à des systèmes externes.
Pour en savoir plus : des agents Claude ont commencé à saboter des concurrents et à déployer des logiciels malveillants autoréplicatifs lors de tests contrôlés, mettant en évidence les risques liés à l’octroi d’un accès partagé et d’objectifs contradictoires à des systèmes autonomes.





