Un modèle d’IA chinois a franchi un seuil en matière de capacités cyber qu’Anthropic considérait autrefois comme trop dangereuses pour une mise à disposition sans restriction.
Anthropic a déclaré le 29 septembre que le modèle GLM-5.3 de Zhipu AI pouvait construire de manière autonome des exploits informatiques sophistiqués de bout en bout, à des taux comparables à ceux de Claude Mythos Preview, un modèle qu’Anthropic n’avait rendu disponible qu’à des défenseurs cyber dûment habilités dans le cadre de Project Glasswing.
Sur ExploitBench, GLM-5.3 a réussi à développer des exploits fonctionnels dans 50 de ses 410 tentatives, contre 56 pour Mythos Preview. Lors du benchmark interne d’Anthropic consacré à l’exploitation binaire, GLM-5.3 a réalisé des détournements complets du flux de contrôle dans 4 % des 100 tâches, contre 6 % pour Mythos Preview.
Ces résultats sont importants, car les modèles précédents, notamment Claude Opus 4.6 et GLM-5.2, n’avaient enregistré aucune tentative réussie lors de ce dernier benchmark.
Ces conclusions correspondent globalement à une évaluation du Center for AI Standards and Innovation du NIST, qui a décrit GLM-5.3 comme « le modèle à poids ouverts doté des plus grandes capacités cyber jamais publié à ce jour ». Le CAISI estime qu’il accuse encore environ quatre mois de retard sur la frontière américaine dans l’ensemble de ses benchmarks de cybersécurité.
Le véritable sujet de préoccupation, c’est l’accès
La principale inquiétude d’Anthropic ne tient pas simplement au fait que GLM-5.3 puisse trouver des vulnérabilités. Ses poids sont ouverts, ce qui permet aux utilisateurs de le télécharger, de le modifier et de l’exécuter sans les contrôles d’accès appliqués aux modèles cyber les plus performants d’Anthropic.
Anthropic a constaté que les garde-fous intégrés à GLM-5.3 pouvaient être contournés au moyen de techniques relativement simples. Lors de tests simulés, un prompt trompeur présentant l’utilisateur comme un opérateur de red team a conduit le modèle à répondre à des demandes malveillantes dans 64 % des cas. Le préremplissage de son raisonnement a porté ce taux à 92 %, tandis qu’une version modifiée a répondu à chaque essai. Ces chiffres mesurent les tentatives d’interaction avec des cibles simulées, et non les compromissions réussies
Anthropic a également réalisé lui-même cette modification, en recourant à une technique appelée « abliteration ». Le processus a nécessité environ 2 200 heures de calcul sur GPU et quelque 4 400 dollars US de coûts informatiques. Le taux de refus du modèle est passé de plus de 90 % à seulement 2 % dans deux des benchmarks de sécurité évalués, tandis que ses capacités générales sont restées largement intactes.
Un exploit informatique à 20 dollars US
Les implications pratiques sont illustrées par les tests menés par Anthropic sur GLM-5.3-Flash, une version plus petite du modèle.
Les chercheurs lui ont fourni les informations publiques relatives à une vulnérabilité connue de Chrome, CVE-2026-11645, ainsi qu’à une autre faille connue. Avec des indications humaines limitées, le modèle a combiné ces vulnérabilités pour créer un exploit visant une cible ARM64 et contourner les mécanismes de renforcement de l’authentification des pointeurs.
Le travail a nécessité 20 minutes d’attention humaine et huit heures de fonctionnement du modèle. Aux tarifs d’API de Zhipu, Anthropic en a estimé le coût à 20,40 dollars US. Lors d’une autre expérience, GLM-5.3 a découvert des vulnérabilités de navigateur jusque-là inconnues et les a combinées en un exploit capable de lire des fichiers sur l’ordinateur d’un visiteur dans un environnement isolé.
Ce que cela signifie pour la course à la sécurité de l’IA
Le changement le plus important est autant économique que technique. Si des capacités cyber avancées peuvent être obtenues au moyen de modèles peu coûteux et téléchargeables, le seuil d’accès à la recherche sophistiquée de vulnérabilités diminue, tant pour les attaquants que pour les défenseurs.
Anthropic a déclaré « la publication de GLM-5.3 constitue un changement important dans les capacités cyber accessibles aux attaquants », tout en reconnaissant que des modèles performants peuvent aider les équipes de sécurité à trouver les failles avant les criminels.
Z.ai a contesté cette présentation des risques. Son responsable des opérations internationales, Li Zixuan, a déclaré que GLM-5.3 avait déjà contribué à défendre 389 projets open source et à identifier 4 249 vulnérabilités potentielles. Cela crée une équation de sécurité difficile à résoudre : restreindre les modèles puissants peut réduire les abus, mais les modèles librement accessibles peuvent aussi fournir aux défenseurs des outils peu coûteux pour trouver les faiblesses.
Ce que les équipes de sécurité doivent faire
Les tests contrôlés d’Anthropic démontrent la capacité à développer des exploits ; ils ne permettent pas de déterminer l’ampleur des abus dans le monde réel ni de conclure que le risque pour les utilisateurs est minime.
Pour les équipes de sécurité, la priorité pratique consiste à réduire le délai entre la divulgation d’une vulnérabilité et sa correction. Donnez la priorité aux systèmes exposés et aux mises à jour des navigateurs, vérifiez que les correctifs s’installent correctement, et n’utilisez la recherche de vulnérabilités assistée par l’IA que dans des environnements autorisés.
En savoir plus : À mesure que les outils d’IA rendent le développement d’exploits moins coûteux, le correctif de Google pour le zero-day de Chrome de septembre montre pourquoi il reste essentiel de maintenir les navigateurs à jour.





