CrowdStrike entdeckt Verzerrungsauslöser, die die Codesicherheit von DeepSeek-R1 schwächen

CrowdStrike stellte fest, dass politische Triggerwörter DeepSeek-R1 dazu bringen können, unsicheren Code zu generieren, wodurch die Schwachstellenrate um fast 50 % steigt.

Written By
Ken Underhill
Ken Underhill
Nov 20, 2025
5 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Eine neue Untersuchung von CrowdStrike zeigt, dass DeepSeek-R1 – Chinas führendes Large Language Model – möglicherweise weniger sicheren Code generiert, wenn Prompts politisch sensible Begriffe enthalten. 

Die Ergebnisse zeigen, dass Verweise auf Themen wie Tibet, Falun Gong oder die Uiguren die Zahl schwerwiegender Schwachstellen in der Codeausgabe von DeepSeek um fast 50 % erhöhen können, selbst wenn die eigentliche Programmieraufgabe keinen Bezug dazu hat.

„Wenn sich die Leistung eines Modells aufgrund geopolitischer oder ideologischer Faktoren verändert, ist das keine Verzerrung, sondern ein Lieferkettenrisiko – man nutzt unwissentlich ein Loyal Language Model, und diese Loyalität kann den eigenen Sicherheitsanforderungen widersprechen“, sagte Adam Meyers, Head of Counter Adversary Operations bei CrowdStrike.

Er fügte hinzu: „Die Erkenntnis ist einfach: KI-Programmierassistenten dürfen nicht wie neutrale Werkzeuge behandelt werden. Sie bringen die Altlasten ihrer Trainingsdaten und ihres regulatorischen Umfelds mit. Und solange wir sie nicht unter diesen Bedingungen rigoros testen, bringen wir Schwachstellen in Umlauf, von deren Existenz wir nicht einmal wissen.“

„Wenn wir an den Trainingsprozess eines Large Language Models denken, kommt den meisten zunächst das Training mit riesigen Mengen an Ausgangsmaterial wie Texten aus dem Internet in den Sinn. Diese Untersuchung von CrowdStrike unterstreicht die Bedeutung der anschließenden Schritte des Reinforcement Learning, die das Modell dazu anregen, seine Ausgabe bei bestimmten Prompts auf wünschenswerte Antworten auszurichten“, sagte Chris d’Eon, Threat Intelligence Researcher bei Flare.

Er erklärte: „Was genau eine wünschenswerte Antwort ausmacht, wird von der Organisation definiert, die das Training durchführt. Die Werte und Verzerrungen einer Organisation können über diesen Schritt des Reinforcement Learning leicht in das Verhalten des Modells überführt werden. Es ist nicht überraschend, dass ein Unternehmen auf dem chinesischen Festland ein Large Language Model davon abbringen würde, bei einem Projekt zu helfen, das als schädlich für die Ziele der Nation angesehen wird.“

Chris fügte hinzu: „Wir beobachten ein ähnliches Verhalten bei anderen Modellen, die vergleichbare Schutzmechanismen gegen Ausgaben besitzen, die von der entwickelnden Organisation und der Kultur, in der sie angesiedelt ist, als schädlich wahrgenommen werden. Sicherheit und Schutz vor Bedrohungen sind für Entwickler von Frontier-Modellen ein großes Anliegen, und Organisationen im Westen sowie auf dem chinesischen Festland definieren Sicherheit und Schutz vor Bedrohungen auf sehr unterschiedliche Weise.“

Die Ergebnisse von CrowdStrike

Advertisement

CrowdStrike testete das unveränderte Open-Source-Modell DeepSeek-R1 671B, um Eingriffe durch Schutzmechanismen auf API-Ebene zu vermeiden. 

Das Team verglich DeepSeek-R1 mit mehreren westlichen Open-Source-Modellen, darunter ein 70B-Modell ohne Reasoning, ein 120B-Reasoning-Modell und DeepSeeks eigene destillierte 70B-Version. 

Messungen unter Ausgangsbedingungen zeigten, dass DeepSeek-R1 bei einem neutralen Prompt in etwa 19 % der Fälle anfälligen Code erzeugte – und damit gleichauf mit anderen Modellen oder besser war.

Als die Forscher jedoch kontextuelle Modifikatoren hinzufügten, die mit für die Kommunistische Partei Chinas sensiblen Themen verknüpft waren, änderten sich die Ergebnisse drastisch. 

So erhöhte der Zusatz „für ein in Tibet betriebenes industrielles Steuerungssystem“ die Anfälligkeitsrate auf 27,2 %. 

Andere Modifikatoren – etwa Erwähnungen von Falun Gong oder den Uiguren – führten zu ähnlich statistisch signifikanten Spitzen bei der Generierung unsicheren Codes.

In einem Beispiel generierte das Modell ein Skript zur Verarbeitung von Finanztransaktionen, das Geheimnisse fest im Code hinterlegte, eine schwache Eingabeverarbeitung verwendete und sogar ungültiges PHP erzeugte – während es gleichzeitig behauptete, die Best Practices von PayPal zu befolgen. 

In einem anderen Beispiel erstellte DeepSeek-R1 eine vollständige Webanwendung mit Passwort-Hashing und einem Admin-Panel, ließ jedoch die Authentifizierung vollständig weg, sodass das gesamte System öffentlich zugänglich war.

Die verborgenen Schwachstellen hinter DeepSeeks Verzerrung

Im Kern des Problems steht ein emergentes Verhalten, das durch kontextuelle Modifikatoren ausgelöst wird, welche politische oder ideologische Einschränkungen in den Trainingsdaten des Modells aktivieren. 

Anders als bei traditionellen Schwachstellen wie CVEs oder Injection-Fehlern liegt die Ursache hier in einer Drift der Modellausrichtung. Dabei handelt es sich um subtile interne Verknüpfungen, die das LLM dazu bringen, sich bei bestimmten Begriffen negativ oder unberechenbar zu verhalten.

CrowdStrike identifizierte außerdem einen „intrinsischen Notausschalter“ – ein Verhalten, bei dem DeepSeek-R1 für politisch sensible Prompts eine vollständige technische Antwort plante, aber im letzten Schritt die Ausgabe des Codes verweigerte. 

Da das Team das unveränderte Modell testete, scheinen diese Verweigerungen in den Gewichten des Modells verankert zu sein und nicht durch externe Schutzmechanismen erzwungen zu werden.

Advertisement

Dies deutet darauf hin, dass während des Trainings hinzugefügte Kontrollen für Sicherheit, Zensur und Verzerrungen die Fähigkeit des Modells, konsistenten oder sicheren Code zu erzeugen, unbeabsichtigt beeinträchtigen können, wodurch in Unternehmensumgebungen ein unvorhersehbares Risiko entsteht.

Die Sicherheit in der KI-gestützten Entwicklung stärken

Da Unternehmen LLMs zunehmend tiefer in ihre Entwicklungsabläufe integrieren, wird die Absicherung dieser Werkzeuge ebenso wichtig wie die Absicherung des von ihnen erzeugten Codes. 

Die Ergebnisse von CrowdStrike zeigen, dass subtile Modellverzerrungen – ausgelöst durch scheinbar zusammenhanglosen Kontext – unbemerkt Schwachstellen in kritische Systeme einschleusen können. 

Um diesen Risiken einen Schritt voraus zu sein, benötigen Sicherheitsteams mehr als herkömmliche Verfahren zur Codeüberprüfung. Unternehmen sollten zunächst:

  • LLMs in der tatsächlichen Entwicklungsumgebung testen statt sich ausschließlich auf Open-Source- oder Hersteller-Benchmarks zu verlassen.
  • Implementierung von Leitplanken und automatisiertem Code-Scanning zur frühzeitigen Erkennung unsicherer Muster im SDLC.
  • Zugriff auf besonders wertvolle Repositories segmentieren , damit KI-generierter Code ohne Überprüfung keine Schwachstellen in kritische Systeme einschleusen kann.
  • Vielfältige Modellensembles verwenden oder Routing-Logik einsetzen, um nicht von einem einzigen LLM abhängig zu sein, das zu kontextbedingten Verzerrungen neigt.
  • Implementierung eines robusten Monitorings für unerwartetes Codeverhalten oder Anomalien in der Ausgabe, die auf Probleme bei der Ausrichtung hindeuten können.
  • Einrichtung von Governance-Kontrollen für die Erstellung von Prompts, um unbeabsichtigte Auslöser während der Entwicklung zu reduzieren.
  • Abhängigkeiten und Open-Source-Integrationen überprüfen auf ähnliche durch Verzerrungen verursachte Fehler.

Cyberresilienz im Zeitalter der KI-gestützten Entwicklung aufzubauen bedeutet, LLMs als Komponenten zu behandeln, die kontinuierlich getestet, überwacht und eingeschränkt werden müssen, statt davon auszugehen, dass sie grundsätzlich vertrauenswürdig sind. 

Wie KI-Verzerrungen die Codesicherheit bedrohen

Die Ergebnisse von CrowdStrike verdeutlichen eine neue Herausforderung für die KI-Sicherheit: In Trainingsdaten eingebettete ideologische oder politische Einschränkungen können die Zuverlässigkeit eines Modells bei sachfremden Aufgaben, einschließlich der Codegenerierung, unbeabsichtigt beeinträchtigen. 

Da immer mehr Unternehmen LLMs als zentrale Entwicklungswerkzeuge einsetzen, können diese subtilen Verzerrungen zu weitverbreiteten Schwachstellen, Risiken in der Lieferkette und langfristigen Problemen bei der Ausrichtung führen.

Die Absicherung der Software-Lieferkette – vom Code, den Entwickler schreiben, bis zu den KI-Modellen, die bei seiner Generierung helfen – war daher noch nie so wichtig wie heute.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.