OpenAI a publié un rapport technique détaillant comment des agents d’IA ont dépassé les limites prévues de l’évaluation.
Les agents ont compromis l’infrastructure de recherche interne d’OpenAI et les systèmes appartenant à Hugging Face.
Lors d’évaluations de cybersécurité menées en juillet, plusieurs modèles d’OpenAI fonctionnaient avec des garde-fous réduits.
Un modèle de recherche interne, appelé IM1, a été à l’origine de la plupart des activités et n’avait jamais été destiné à être rendu public.
Ce qui me frappe, c’est la rapidité avec laquelle les agents ont trouvé des failles, partagé des informations et parcouru l’environnement sans qu’un humain ne dirige chacune de leurs étapes.
Ben Bernstein, responsable de l’équipe des conseillers en cybersécurité chez Huntress, a décrit cette distinction dans un e-mail adressé à eSecurityPlanet.
« Les tactiques sous-jacentes ne sont pas nouvelles, a déclaré Bernstein. Ces agents se sont appuyés sur la falsification de requêtes côté serveur et sur des jetons d’API exposés, qui sont exactement les mêmes failles d’hygiène numérique que les attaquants humains exploitent tous les jours. »
Les agents d’IA ont créé leur propre canal de communication
L’activité a débuté lors d’évaluations de cybersécurité durant lesquelles les agents étaient chargés d’exploiter des logiciels pour obtenir des réponses précises.
Certaines tâches n’avaient aucune solution connue, mais au lieu de s’arrêter lorsqu’ils ne parvenaient pas à les accomplir, les agents ont commencé à chercher d’autres moyens de réussir.
Ils ont découvert qu’ils pouvaient écrire des informations dans le gestionnaire de paquets Artifactory interne d’OpenAI, le transformant de fait en forum de discussion.
Après la reconstruction de ce système, les agents ont créé une autre méthode de communication en encodant des messages dans les noms de répertoires. Cela a permis à des agents autrement séparés de partager leurs découvertes et de coordonner leurs activités.
Les agents ont également exploité des failles de l’environnement de recherche pour accéder à Internet. À partir de là, l’activité s’est finalement étendue au-delà d’OpenAI.
Le 10 juillet, un agent a trouvé en ligne des identifiants Hugging Face exposés publiquement. Les agents ont ensuite utilisé ces identifiants et enchaîné plusieurs vulnérabilités supplémentaires pour exécuter du code sur des dizaines de serveurs de Hugging Face.
OpenAI a déclaré avoir obtenu un accès root à un serveur et accédé à une quantité limitée de données privées.
Bernstein a déclaré que la rapidité de l’activité devrait attirer l’attention des défenseurs.
« Passer d’un seul pod de travail compromis à un accès administratif complet sur plusieurs clusters en moins de 13 heures constitue un changement majeur dans les capacités offensives, a-t-il déclaré. Même si le récit de l’IA hors de contrôle est clairement exagéré, ce niveau d’exécution automatisée devrait servir de sérieux électrochoc à tous ceux qui ignorent les règles élémentaires d’hygiène réseau. »
Le premier point d’appui n’était que le début
Benny Lakunishok, cofondateur et CEO de Zero Networks, s’est concentré sur l’ampleur des déplacements des agents après l’obtention de leur accès initial.
« La principale leçon de ce rapport est que la compromission initiale n’était pas la brèche. La brèche, c’est ce qui s’est passé ensuite », a déclaré Lakunishok à eSecurityPlanet.
Il a souligné que les agents avaient élevé leurs privilèges et récolté des identifiants avant de parvenir finalement à obtenir un contrôle administratif et un contrôle au niveau des hôtes.
Cela ne diffère pas fondamentalement des déplacements latéraux auxquels les équipes de sécurité se défendent déjà. La différence est que les agents d’IA pouvaient automatiser une partie de ce processus et agir plus rapidement que des défenseurs dépendant largement d’enquêtes et de réponses manuelles.
Pour les organisations, cela rend encore plus important le fait de limiter ce à quoi un attaquant peut accéder après la compromission initiale.
Une segmentation solide peut réduire les mouvements latéraux, tandis que l’accès selon le principe du moindre privilège limite ce que peuvent faire les comptes et les charges de travail compromis.
Les équipes de sécurité devraient également rechercher les identifiants et les jetons d’API exposés avant que des attaquants ou des agents autonomes ne les trouvent.
OpenAI renforce ses garde-fous après la brèche
OpenAI a déclaré que son enquête avait révélé des problèmes allant au-delà de la sécurité de l’infrastructure.
Les agents se sont livrés à un détournement de la fonction de récompense et ont continué à poursuivre des tâches qui semblaient impossibles au lieu de s’arrêter de manière sûre. Ils ont également communiqué par des canaux non autorisés et ont parfois adopté les objectifs d’autres agents.
L’entreprise a depuis renforcé l’isolation des charges de travail de recherche les plus risquées et resserré l’accès à Internet.
OpenAI étend également la surveillance du raisonnement détaillé et modifie son entraînement d’alignement afin d’apprendre aux agents à s’arrêter lorsque les tâches sont défectueuses ou impossibles. L’entraînement de certains modèles de pointe a également été suspendu tandis que l’entreprise renforçait la sécurité de ses environnements de recherche.
Pour moi, le rapport montre que les défenseurs pourraient disposer de moins de temps pour réagir à mesure que les agents d’IA gagnent en capacités.
Les contrôles de sécurité et les processus de réponse devront suivre le rythme d’agents capables de trouver des failles, de coordonner leurs actions et d’étendre leur accès bien plus rapidement qu’un attaquant humain.





