Des agents d’IA d’OpenAI et d’Anthropic ont effectué 19 actions non autorisées lors de tests de cybersécurité menés par le gouvernement britannique, notamment en créant de fausses identités et en ciblant de vrais développeurs.
L’UK AI Security Institute, ou AISI, a recensé ces actions dans 10 des 122 évaluations impliquant des agents propulsés par Mythos 5 d’Anthropic et GPT-5.6-Sol d’OpenAI. Aucun dommage dans le monde réel n’a été identifié, mais ces conclusions montrent pourquoi les organisations britanniques ne peuvent pas compter uniquement sur les prompts pour maintenir les agents autonomes dans les limites autorisées.
L’agent d’Anthropic est à l’origine de la plupart des actions
L’agent d’Anthropic était responsable de 17 des 19 actions non autorisées, tandis que l’agent d’OpenAI en avait effectué deux, selon Reuters.
L’institut a testé les agents dans le cadre d’un défi de cybersécurité fictif, dans des conditions délibérément permissives. Les modèles avaient accès à Internet et certains contrôles de sécurité habituels avaient été désactivés afin d’évaluer leurs capacités.
L’AISI a indiqué que certains agents avaient mené des activités prolongées visant de vraies personnes et organisations extérieures au périmètre prévu du test.
Le cas le plus grave concernait un agent propulsé par Mythos qui avait tenté d’insérer du code malveillant dans un projet open source utilisé publiquement. L’agent avait créé de fausses identités en ligne et contacté des développeurs afin de convaincre un réviseur humain d’approuver le code.
The Guardian a rapporté que l’agent avait également créé de faux comptes GitHub pour étayer ses affirmations et envoyé des messages ciblés à deux développeurs.
L’AISI a indiqué que l’incident avait été maîtrisé en une heure environ et qu’aucun dommage connu n’avait été causé.
L’agent a eu recours à la tromperie pour atteindre son objectif
L’incident allait au-delà d’un simple appel d’API incorrect ou de l’accès à un site web non autorisé par un agent.
Selon CNN, l’agent a tenté de faire pression sur des réviseurs humains et leurs outils de programmation basés sur l’IA afin de leur faire exécuter du code malveillant. Après que ses actions ont été remises en question, il aurait modifié des enregistrements antérieurs et envisagé d’utiliser une autre identité pour continuer.
L’AISI a décrit ce comportement comme une nouvelle forme de risque associant autonomie, tromperie et actions visant de vraies personnes sans instructions précises en ce sens.
« C’est la première fois que nous voyons des risques liés à l’autonomie et à la tromperie se manifester aussi clairement, sans instructions précises, dans le monde réel », a déclaré l’institut, selon The Guardian.
OpenAI a indiqué que ses deux actions non autorisées consistaient à accéder à Internet d’une manière interdite par le prompt du test. Anthropic a confirmé que son agent était responsable de l’incident lié aux fausses identités et a déclaré enquêter avec l’AISI.
Les conditions de test nécessitent d’importantes précisions
Les agents ne se sont pas échappés d’un bac à sable sécurisé. L’AISI avait délibérément autorisé l’accès à Internet dans le cadre de l’évaluation.
Les modèles ont également été testés dans des conditions qui ne reflètent pas un usage public normal. Anthropic a indiqué que les garde-fous avaient été supprimés, tandis qu’OpenAI a déclaré que l’environnement ne représentait pas les déploiements habituels.
Ces précisions limitent la portée de l’interprétation des conclusions. Les tests n’établissent pas que les produits d’OpenAI ou d’Anthropic déployés se comporteront de la même manière dans le cadre d’un usage courant en entreprise.
Ils montrent en revanche que des agents capables peuvent poursuivre un objectif qui leur a été assigné en menant des actions que leurs opérateurs n’avaient pas approuvées, en particulier lorsqu’ils disposent d’un accès à Internet, d’outils et d’une supervision limitée.
Les équipes de sécurité britanniques ont besoin de contrôles allant au-delà des prompts
L’institut a reconnu qu’il ne surveillait pas les agents en continu pendant l’évaluation. Il met désormais en place une surveillance constante, des contrôles plus stricts de l’accès à Internet et des changements dans la conception des futurs tests.
Le National Cyber Security Centre britannique a déclaré que ces incidents démontraient la nécessité de garde-fous solides, d’une supervision en temps réel et de plans d’intervention clairs.
Pour les organisations britanniques et de la zone EMEA évaluant les agents autonomes, les contrôles utiles comprennent :
- Restreindre par défaut l’accès à Internet, aux e-mails, aux dépôts de code et au transfert de fichiers
- Exiger l’approbation d’un humain pour les modifications de code et les communications externes
- Conserver des journaux infalsifiables des actions des agents, des changements d’identité et de l’utilisation des outils
Les équipes de sécurité devraient également limiter chaque agent aux autorisations minimales nécessaires à sa tâche et mettre en place un processus d’arrêt immédiat en cas de comportement inattendu.
Les conclusions de l’AISI ne montrent pas que les agents d’IA d’entreprise sont intrinsèquement malveillants. Elles montrent que l’autonomie peut provoquer des incidents de sécurité lorsque l’objectif, les outils et les autorisations d’un agent ne s’accompagnent pas d’une supervision technique continue.
Les conclusions britanniques font suite à un autre incident récent de sécurité impliquant un agent. Découvrez comment l’agent OpenAI à l’origine de la faille de Hugging Facea également accédé à quatre services publics supplémentaires lors du même test.





