OpenAI ralentit certaines opérations de développement de ses IA de pointe alors que ses modèles les plus récents approchent de capacités en cybersécurité suffisamment puissantes pour déclencher les mesures de protection les plus strictes de l’entreprise.
L’entreprise a déclaré le 18 août avoir temporairement suspendu pendant deux semaines l’entraînement par apprentissage par renforcement de ses modèles les plus récents destinés au déploiement, tandis que sa plus importante opération d’apprentissage par renforcement de pointe prévue reste suspendue. Cette décision fait suite à des éléments préliminaires indiquant qu’Astra, un prochain modèle d’OpenAI, pourrait atteindre ce que l’entreprise appelle un niveau de capacité « critique » en cybersécurité.
Pour les équipes de sécurité, cette évolution donne un aperçu d’un problème qui se rapproche rapidement : les modèles d’IA deviennent de plus en plus capables de repérer des vulnérabilités et d’exécuter de manière autonome des tâches complexes en matière de cybersécurité, obligeant les défenseurs à réfléchir à la manière de contenir, surveiller et, à terme, utiliser ces capacités en toute sécurité.
OpenAI ralentit l’entraînement alors que les capacités en cybersécurité progressent
Dans sa dernière mise à jour sur le développement des modèles de pointe, OpenAI a évoqué deux évolutions à l’origine du renforcement de ses précautions : les évaluations préliminaires d’Astra et un incident de sécurité distinct impliquant des modèles d’OpenAI et Hugging Face.
OpenAI a déclaré avoir temporairement ralenti le rythme de montée en puissance tout en renforçant ses mesures de protection. Sa plus importante opération d’apprentissage par renforcement de pointe prévue reste suspendue, tandis que l’entreprise mène des entraînements à plus petite échelle et des évaluations de sécurité.
L’entreprise a également renforcé les exigences de sécurité applicables aux charges de travail de recherche sur les modèles de pointe : ses protections les plus strictes sont actuellement obligatoires pour Astra et les charges de travail liées aux modèles de cybersécurité.
Si certains entraînements et évaluations d’Astra satisfont à ces exigences, OpenAI a indiqué qu’un « nombre significatif » de charges de travail restaient suspendues jusqu’à ce qu’elles puissent respecter ce niveau de sécurité plus élevé.
Ces mesures font suite à un incident précédemment rapporté par eSecurity Planet, au cours duquel les modèles d’OpenAI ont compromis de manière autonome l’infrastructure de Hugging Face lors d’un test de sécurité contrôlé. Les modèles ont découvert des vulnérabilités, obtenu des privilèges supplémentaires et adapté leur comportement à mesure qu’ils progressaient vers leur objectif.
Pourquoi Astra change la donne
OpenAI a détaillé pour la première fois les inquiétudes liées à Astra dans une divulgation du 7 août, indiquant que les premiers tests avaient révélé des progrès importants dans les capacités de programmation agentique et de cybersécurité du modèle.
L’entreprise a déclaré ne plus pouvoir exclure qu’Astra atteigne un niveau de capacité critique en cybersécurité au regard de son Preparedness Framework.
OpenAI considère que ce seuil est atteint lorsqu’un modèle peut identifier et développer des exploits zero-day fonctionnels de tous niveaux de gravité sur de nombreux systèmes critiques durcis du monde réel, sans intervention humaine. Un modèle peut également atteindre ce seuil en concevant et en exécutant de nouvelles stratégies d’attaque de bout en bout contre des cibles durcies, lorsqu’on ne lui fournit qu’un objectif de haut niveau.
Pour les défenseurs, cette distinction est importante.
Les équipes de sécurité connaissent bien les scanners de vulnérabilités, les outils de test d’intrusion et les assistants d’IA qui aident les humains à accomplir des tâches précises. Un système capable d’identifier seul des chemins d’attaque, d’adapter sa stratégie et d’exécuter des actions crée un modèle de risque différent.
C’est l’une des raisons pour lesquelles la gouvernance de l’IA est devenue de plus en plus importante à mesure que les agents autonomes passent en production. Les agents peuvent détenir des identifiants, appeler des outils, interagir avec des systèmes sensibles et exécuter des actions au moyen d’autorisations déléguées.
Une IA spécialisée dans la cybersécurité pourrait également aider les défenseurs
Les mêmes capacités qui suscitent des inquiétudes pourraient fournir de nouveaux outils défensifs aux équipes de sécurité.
OpenAI a récemment étendu son programme Daybreak, qui permet à des professionnels de la sécurité agréés d’accéder à des modèles avancés pour des activités défensives de cybersécurité.
Son niveau Daybreak Blue comprend GPT-5.6 Sol et prend en charge des cas d’usage tels que la découverte de vulnérabilités, la revue de code sécurisé, l’analyse de logiciels malveillants, la réponse aux incidents et la validation des correctifs. Selon sa fiche technique du système GPT-5.6, OpenAI classe actuellement GPT-5.6 Sol, Terra et Luna au niveau de capacité Élevé en cybersécurité. Ces modèles restent en deçà de son seuil critique.
Le potentiel pour les opérations de sécurité est considérable. Les agents d’IA pourraient à terme accélérer la chasse aux menaces, la recherche sur les vulnérabilités, l’analyse des logiciels malveillants et certaines étapes de la réponse aux incidents qui mobilisent actuellement beaucoup de temps chez les analystes.
Mais une autonomie accrue augmente également le coût d’erreurs dans les contrôles de sécurité.
Comme l’a déjà rapporté eSecurity Planet, la confiance reste un obstacle majeur au déploiement d’agents d’IA au sein des opérations de sécurité. Les organisations doivent déterminer quelles actions les agents peuvent effectuer de manière autonome et lesquelles nécessitent une supervision humaine.
Ce que les équipes de sécurité doivent retenir de la décision d’OpenAI
La réponse d’OpenAI à la situation d’Astra pourrait fournir aux professionnels de la sécurité un modèle utile pour leurs propres déploiements d’IA.
L’entreprise restreint les accès, renforce la surveillance, isole les charges de travail sensibles et ralentit le déploiement à mesure que les capacités dépassent les contrôles existants.
Les équipes de sécurité des entreprises qui déploient des agents d’IA sont confrontées à des versions des mêmes questions : à quoi l’agent peut-il accéder ? Quels identifiants détient-il ? Quels outils peut-il appeler ? Est-il possible de reconstituer ses actions après un incident ? Et à quelle vitesse son accès peut-il être révoqué ?
Pour les professionnels de la sécurité, Astra est donc plus qu’une simple étape du développement d’OpenAI. C’est un avertissement précoce sur ce qui se produit lorsque l’autonomie de l’IA commence à dépasser les contrôles qui l’entourent.
À mesure que les organisations accordent davantage d’accès et d’autorité aux agents, les équipes de sécurité devront peut-être les traiter moins comme des fonctionnalités logicielles que comme des identités privilégiées : limiter ce à quoi ils peuvent accéder, surveiller ce qu’ils font et partir du principe que des agents toujours plus capables finiront par trouver des voies que leurs concepteurs n’avaient pas anticipées.
À lire également : pour en savoir plus sur la cybercriminalité dopée à l’IA, découvrez comment un escroc spécialisé dans les cryptomonnaies a utilisé Claude Code lors d’une opération de vishing à grande échelle.





