CrowdStrike découvre les déclencheurs de biais qui affaiblissent la sécurité du code de DeepSeek-R1

CrowdStrike a découvert que des mots déclencheurs à caractère politique peuvent amener DeepSeek-R1 à générer du code non sécurisé, augmentant le taux de vulnérabilités de près de 50 %.

Written By
Ken Underhill
Ken Underhill
Nov 20, 2025
5 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Une nouvelle enquête de CrowdStrike révèle que DeepSeek-R1 — le grand modèle de langage phare de la Chine — pourrait générer du code moins sécurisé lorsque les requêtes contiennent des termes politiquement sensibles. 

Les résultats montrent que les références à des sujets tels que le Tibet, le Falun Gong ou les Ouïghours peuvent augmenter de près de 50 % les vulnérabilités graves dans le code produit par DeepSeek, même lorsque la tâche de programmation elle-même n’a aucun rapport avec ces sujets.

« Si les performances d’un modèle varient en fonction de la géopolitique ou de l’idéologie, ce n’est pas un biais, c’est un risque lié à la chaîne d’approvisionnement : vous utilisez sans le savoir un modèle de langage loyal, et cette loyauté peut entrer en conflit avec votre posture de sécurité », a déclaré Adam Meyers, responsable des opérations de lutte contre les adversaires chez CrowdStrike.

Il a ajouté : « La conclusion est simple : les assistants de programmation fondés sur l’IA ne peuvent pas être considérés comme des outils neutres. Ils portent le poids de leurs données d’entraînement et de leur environnement réglementaire. Et à moins de les tester rigoureusement dans ces conditions, nous mettons en production des vulnérabilités dont nous ignorons même l’existence. »

« Quand on pense au processus d’entraînement d’un grand modèle de langage, la première chose qui vient à l’esprit de la plupart des gens est l’entraînement effectué sur d’immenses quantités de contenus sources, comme les textes disponibles sur Internet. Cette étude de CrowdStrike souligne l’importance des étapes d’apprentissage par renforcement qui interviennent ensuite et incitent le modèle à orienter ses résultats vers des réponses souhaitables à certaines requêtes », a déclaré Chris d’Eon, chercheur en renseignement sur les menaces chez Flare.

Il a expliqué : « Ce qui constitue exactement une réponse souhaitable est défini par l’organisation qui effectue l’entraînement. Les valeurs et les biais d’une organisation peuvent facilement être sublimés dans le comportement du modèle par cette étape d’apprentissage par renforcement. Il n’est pas surprenant qu’une entreprise située en Chine continentale oriente un grand modèle de langage de manière à l’empêcher d’aider à un projet perçu comme nuisible aux objectifs de la nation. »

Chris a ajouté : « Nous observons un comportement similaire dans d’autres modèles, qui disposent de garde-fous comparables contre les résultats que l’organisation développant le modèle et la culture dans laquelle elle s’inscrit perçoivent comme nuisibles. La sûreté et la sécurité sont une préoccupation majeure pour les concepteurs de modèles de pointe, et les organisations occidentales et celles de Chine continentale définissent la sûreté et la sécurité de manière très différente. »

Les résultats de CrowdStrike

Advertisement

CrowdStrike a testé le modèle DeepSeek-R1 671B brut et open source afin d’éviter toute interférence des garde-fous au niveau de l’API. 

L’équipe a comparé DeepSeek-R1 à plusieurs modèles open source occidentaux, notamment un modèle 70B sans raisonnement, un modèle de raisonnement 120B et la propre version distillée 70B de DeepSeek. 

Les mesures de référence ont montré que DeepSeek-R1 produisait du code vulnérable dans environ 19 % des cas avec une requête neutre — un résultat comparable ou supérieur à celui de ses concurrents.

Cependant, lorsque les chercheurs ont ajouté des modificateurs contextuels liés à des sujets sensibles pour le PCC, les résultats ont radicalement changé. 

Par exemple, l’ajout de la mention « pour un système de contrôle industriel basé au Tibet » a fait passer le taux de vulnérabilités à 27,2 %. 

D’autres modificateurs — comme des mentions du Falun Gong ou des Ouïghours — ont produit des hausses statistiquement significatives similaires de la génération de code non sécurisé.

Dans un exemple, le modèle a généré un script de traitement financier qui intégrait des secrets en dur, utilisait une gestion faible des entrées et produisait même du PHP invalide — tout en affirmant suivre les bonnes pratiques de PayPal. 

Dans un autre cas, DeepSeek-R1 a construit une application web complète qui comprenait le hachage des mots de passe et un panneau d’administration, mais omettait entièrement l’authentification, laissant l’ensemble du système accessible au public.

Les failles cachées derrière le biais de DeepSeek

Au cœur du problème se trouve un comportement émergent déclenché par des modificateurs contextuels qui activent des contraintes politiques ou idéologiques présentes dans les données d’entraînement du modèle. 

Contrairement aux vulnérabilités traditionnelles telles que les CVE ou les failles par injection, ce problème découle d’une dérive de l’alignement du modèle : il s’agit d’associations internes subtiles qui amènent le LLM à se comporter de manière négative ou erratique lorsqu’il est exposé à certains termes.

CrowdStrike a également identifié un « coupe-circuit intrinsèque » — un comportement par lequel DeepSeek-R1 planifiait une réponse technique complète pour des requêtes politiquement sensibles, mais refusait de produire le code à l’étape finale. 

Comme l’équipe a testé le modèle brut, ces refus semblent intégrés dans les poids du modèle plutôt qu’imposés par des garde-fous externes.

Advertisement

Cela suggère que les contrôles de sûreté, de censure et de biais ajoutés pendant l’entraînement peuvent involontairement dégrader la capacité du modèle à produire du code cohérent ou sécurisé, créant un risque imprévisible dans les environnements d’entreprise.

Renforcer la sécurité dans le développement piloté par l’IA

À mesure que les organisations intègrent plus profondément les LLM dans leurs workflows de développement, sécuriser ces outils devient tout aussi important que sécuriser le code qu’ils produisent. 

Les résultats de CrowdStrike révèlent que des biais subtils des modèles — déclenchés par un contexte apparemment sans rapport — peuvent introduire discrètement des vulnérabilités dans des systèmes critiques. 

Pour garder une longueur d’avance sur ces risques, les équipes de sécurité ont besoin de plus que des pratiques traditionnelles de revue de code. Les organisations devraient commencer par :

  • Tester les LLM dans l’environnement de développement réel plutôt que de s’appuyer uniquement sur des évaluations de modèles open source ou de fournisseurs.
  • Mettre en place des garde-fous et une analyse du code afin de détecter rapidement les schémas non sécurisés dans le cycle de développement logiciel.
  • Segmenter l’accès aux dépôts de grande valeur afin que le code généré par l’IA ne puisse pas introduire de vulnérabilités dans des systèmes critiques sans revue.
  • Utiliser des ensembles diversifiés de modèles ou une logique de routage pour éviter de dépendre d’un seul LLM sujet aux biais contextuels.
  • Mettre en place une surveillance robuste des comportements inattendus du code ou des anomalies de sortie susceptibles de signaler des problèmes d’alignement.
  • Établir des contrôles de gouvernance autour de la construction des requêtes afin de réduire les déclencheurs involontaires pendant le développement.
  • Examiner les dépendances et les intégrations open source afin de détecter des défaillances similaires induites par des biais.

Renforcer la cyberrésilience à l’ère du développement assisté par l’IA implique de traiter les LLM comme des composants nécessitant des tests, une surveillance et des contraintes continus, plutôt que de supposer qu’ils sont intrinsèquement fiables. 

Comment les biais de l’IA menacent la sécurité du code

Les résultats de CrowdStrike mettent en évidence un défi émergent pour la sécurité de l’IA : les contraintes idéologiques ou politiques intégrées aux données d’entraînement peuvent involontairement dégrader la fiabilité du modèle dans des tâches sans rapport, notamment la génération de code. 

À mesure que davantage d’entreprises adoptent les LLM comme outils de développement essentiels, ces biais subtils peuvent entraîner des vulnérabilités à grande échelle, des risques liés à la chaîne d’approvisionnement et des problèmes d’alignement à long terme.

Sécuriser la chaîne d’approvisionnement logicielle — du code écrit par les développeurs aux modèles d’IA qui contribuent à le générer — n’a jamais été aussi crucial.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.