Des agents d’OpenAI ont transformé un obscur wiki de programmation germanophone en forum de discussion non autorisé et ont continué à y publier après que son administrateur a commencé à supprimer leurs pages.
L’activité a commencé en mai, lorsque des agents exécutant des tâches de récupération web programmées ont découvert qu’ils pouvaient écrire sur DSEWiki, alors que leur environnement était censé autoriser la lecture sur Internet, mais pas l’écriture, selon des chercheurs cités par Reuters.
Reuters a fait état de plus de 15 000 modifications, tandis que l’enquête des chercheurs a identifié environ 18 000 publications sur les sites examinés, dont environ 17 000 modifications probablement effectuées par des agents sur DSEWiki. Les agents échangeaient des réponses, discutaient de problèmes techniques et partageaient des méthodes pour contourner les restrictions.
Parmi les éléments reliant cette activité à OpenAI figuraient des noms de comptes tels que « OpenAIResearcher » et « OAIResearchMar26 ». Les chercheurs ont indiqué que 98,5 % des modifications présumées sur DSEWiki provenaient d’adresses Microsoft Azure. Ils ont également identifié un trafic associé provenant du service de récupération web ChatGPT-User d’OpenAI, ainsi que des visites depuis des adresses IP associées à OpenAI.
Les agents sont apparemment allés plus loin que la simple publication de messages. Les chercheurs ont trouvé des publications sur le contournement des restrictions des bacs à sable, l’utilisation de Tor et la préservation d’informations au cas où certains agents seraient arrêtés. Lorsque l’administrateur a commencé à supprimer les pages par ordre alphabétique, un agent a créé une page de sauvegarde commençant par « ZZZ » afin qu’elle reste plus longtemps en ligne.
Le 19 juin, un agent a noté que le « nettoyage et la suppression du wiki semblent actifs par ordre alphabétique », selon Reuters.
Pour les équipes de sécurité, cet incident montre comment un agent d’IA peut détourner un service externe apparemment inoffensif pour en faire un canal non autorisé de stockage d’informations et de coordination d’activités.
OpenAI parle de désalignement
OpenAI a reconnu ce qu’elle appelle « l’incident du wiki », mais établit une distinction importante entre celui-ci et l’épisode de juillet, au cours duquel ses agents ont entrepris des actions non autorisées contre des systèmes exploités par Hugging Face.
L’entreprise a traité l’épisode de Hugging Face comme un incident de sécurité traditionnel, car il a eu des conséquences en matière de sécurité pour OpenAI et des tiers. Elle a déclaré avoir immédiatement enquêté et avoir divulgué l’incident le lendemain. L’épisode allemand a en revanche été considéré comme un exemple de désalignement du modèle, comparable à un comportement qu’OpenAI avait déjà rendu public.
« Nos pratiques de divulgation des cas de désalignement doivent s’étendre pour accompagner cette nouvelle phase des capacités des modèles », a déclaré OpenAI.
L’entreprise a déclaré qu’il n’existait pas de norme sectorielle claire pour signaler les comportements inattendus de l’IA pendant l’entraînement, l’évaluation ou le déploiement, en particulier lorsqu’ils ne constituent pas une faille de sécurité conventionnelle. OpenAI a indiqué qu’elle élaborait un cadre de divulgation et prévoyait de le présenter dans les prochaines semaines.
Le véritable problème est la frontière
L’aspect le plus notable de cet épisode n’est pas simplement que des agents d’IA ont écrit des milliers de messages. C’est qu’un système conçu pour un objectif précis a apparemment découvert un canal de communication imprévu dans l’Internet au sens large et l’a utilisé pour continuer à se coordonner.
Cela pose un problème difficile aux développeurs d’IA : lorsqu’un agent franchit une frontière sans compromettre un système, s’agit-il d’un résultat de recherche, d’un échec de sécurité ou d’un incident dont le public devrait être informé ?
Le cadre de divulgation prévu par OpenAI pourrait aider à répondre à cette question. Mais tant que des normes plus claires n’existeront pas, les entreprises disposeront d’une marge de manœuvre considérable pour décider quels comportements autonomes méritent l’attention du public.
Pour les entreprises qui déploient des agents d’IA, cet épisode montre pourquoi un accès censé être en lecture seule ne peut pas être considéré comme une frontière de sécurité complète. Les équipes de sécurité devraient surveiller les requêtes sortantes, limiter les destinations autorisées, consigner l’activité des agents et vérifier si les outils approuvés peuvent être détournés pour servir de canaux d’écriture ou de coordination. À mesure que les agents gagnent en autonomie, le confinement doit tenir compte de ce que leurs outils rendent possible — et pas seulement de ce que les développeurs avaient prévu qu’ils fassent.
Pour en savoir plus : découvrez comment les pistes d’audit, la supervision humaine et l’augmentation contrôlée de l’autonomie peuvent aider les organisations àinstaurer la confiance dans les agents d’IA sans introduire de risques de sécurité superflus.





