Veracode: Von KI generierter Code hat weiterhin Sicherheitsprobleme

Veracode stellt fest, dass von KI generierter Code trotz nahezu perfekter Syntaxleistung anfällig bleibt.

Verfasst von
Ken Underhill
Ken Underhill
Aug 12, 2026
5 minute read
eSecurity Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Generative künstliche Intelligenz (GenAI) hat die Softwareentwicklung rasch verändert, indem sie Entwicklern ermöglicht, funktionierenden Code schneller und in größerem Umfang zu generieren.

Der Veracode-Bericht zur Code-Sicherheit von GenAI 2026 offenbart jedoch eine Diskrepanz zwischen den Fortschritten bei den Programmierfähigkeiten von KI und den Verbesserungen bei der Sicherheit.

Obwohl moderne Large Language Models (LLMs) nahezu perfekt syntaktisch korrekten Code erzeugen können, hat sich ihre Fähigkeit, sicheren Code zu erzeugen, im vergangenen Jahr kaum verbessert.

Diese Erkenntnis deutet darauf hin, dass Unternehmen, die eine KI-gestützte Entwicklung einsetzen, generierten Code als nicht vertrauenswürdig behandeln müssen, bis er geeigneten Sicherheitstests unterzogen wurde.

Die wichtigsten Erkenntnisse des Veracode-Berichts

  • Die Sicherheit von KI-generiertem Code stagniert weitgehend, wobei Veracode trotz nahezu perfekter Syntaxleistung eine durchschnittliche Sicherheitsbestehensquote von etwa 56 % meldet.
  • Fortschrittlichere KI-Modelle sind nicht zwangsläufig sicherer, da auf Programmierung spezialisierte Modelle ähnlich abschnitten wie Allzweckmodelle und größere Modelle nur einen geringen Sicherheitsvorteil zeigten.
  • Die Sicherheitsleistung variiert je nach KI-Modell erheblich, wobei GPT-5.5 mit 68 % führend war, während sechs der 11 getesteten Modelle zwischen 50 % und 53 % erzielten.
  • Programmiersprache und Schwachstellentyp beeinflussen die Sicherheit von KI-Code, wobei Python besser abschnitt als Java und die Ergebnisse je nach Schwachstellenkategorie stark variierten.
  • KI-generierter Code erfordert weiterhin Sicherheitstests und Nachbesserungen, bevor Unternehmen ihn in Produktionsumgebungen einsetzen.

Die Ergebnisse der Veracode-Studie zur KI-Code-Sicherheit 2026 auf einen Blick

ErgebnisErgebnis 2026Bedeutung
Gesamte Sicherheitsbestehensquote von KI-Code56%Bei fast 44 % der Sicherheitstests für Code wurde ein Fehler festgestellt
Syntax-Bestehensquote~100%Funktionierender Code ist nicht zwangsläufig sicherer Code
Leistungsstärkstes ModellGPT-5.5: 68 %Selbst der Spitzenreiter scheiterte bei fast einem Drittel der Sicherheitsaufgaben
Programmiermodelle im Vergleich zu Allzweckmodellen51 % gegenüber 52 %Die Spezialisierung auf Programmierung brachte keinen Sicherheitsvorteil
Große, mittlere und kleine Modelle im Vergleich53% / 51% / 51%Eine größere Modellgröße verbesserte die Sicherheit nicht wesentlich
Modelle mit und ohne Schlussfolgerungen im Vergleich56 % gegenüber 51 %Modelle mit Schlussfolgerungsfähigkeit zeigten einen moderaten Sicherheitsvorteil
Python im Vergleich zu Java63 % gegenüber 30 %Die Sicherheitsleistung variierte je nach Sprache erheblich
Advertisement

Die Sicherheit von KI-generiertem Code stagniert laut Veracode bei 56 %

Veracode bewertete in vier Testrunden mehr als 100 KI-Modelle anhand standardisierter Aufgaben zur Codegenerierung, die mehrere Programmiersprachen und Schwachstellenkategorien umfassten.

Der Bericht ergab, dass die durchschnittliche Sicherheitsbestehensquote 2026 bei etwa 56 % lag.

Bei rund 44 % der Aufgaben zur Codegenerierung entstand Code mit einer erkennbaren Schwachstelle aus den OWASP Top 10.

Zum Vergleich: Die Modelle erzeugten kompilierbaren Code mit einer Syntax-Bestehensquote von nahezu 100 %.

Funktionierender, von KI generierter Code ist nicht immer sicher

Die Lücke verdeutlicht einen wichtigen Unterschied zwischen funktionierender und sicherer Software: Code, der kompiliert und erwartungsgemäß funktioniert, ist nicht zwangsläufig sicher für den Einsatz.

Die Ergebnisse von Veracode zeigen, dass LLMs zwar die Syntax nahezu gemeistert haben, ihre Sicherheitsleistung über die jüngsten Modellgenerationen hinweg jedoch relativ unverändert geblieben ist.

Die Sicherheit von KI-Code variiert je nach Modell

Auch die Leistung einzelner Modelle variiert beträchtlich.

OpenAIs GPT-5.5 erzielte in der Veracode-Rangliste für den Sommer 2026 mit 68 % die höchste Sicherheitsbestehensquote, gefolgt von GPT-5.3-Codex und Anthropics Claude-Opus-4.8 mit jeweils 62 %.

Sechs der 11 für die Rangliste bewerteten Modelle erzielten jedoch zwischen 50 % und 53 %.

Größere KI-Modelle garantieren keinen sichereren Code

Eine wichtige Erkenntnis lautet, dass speziell für die Programmierung entwickelte Modelle nicht zwangsläufig sicherer sind.

Auf Programmierung spezialisierte Modelle erzielten eine durchschnittliche Sicherheitsbestehensquote von 51 %, verglichen mit 52 % bei Allzweckmodellen.

Dies deutet darauf hin, dass die Optimierung eines KI-Systems für eine effiziente Codegenerierung nicht automatisch seine Fähigkeit verbessert, Sicherheitslücken zu erkennen oder zu vermeiden.

Advertisement

Schlussfolgerungsfähigkeit ist für die Sicherheit wichtiger als die Größe des KI-Modells

Auch eine Vergrößerung des Modells bringt nur einen geringen Sicherheitsvorteil.

Große Modelle mit mehr als 100 Milliarden Parametern erzielten eine durchschnittliche Sicherheitsbestehensquote von 53 %, während mittlere und kleine Modelle jeweils auf etwa 51 % kamen.

Modelle mit Schlussfolgerungsfähigkeit schnitten etwas besser ab und erzielten durchschnittlich 56 %, verglichen mit 51 % bei Modellen ohne diese Fähigkeit.

Veracode zufolge kann der zusätzliche Schlussfolgerungsprozess ähnlich wie eine interne Codeprüfung wirken.

Die Sicherheit von KI-Code variiert je nach Programmiersprache

Die Sicherheitsleistung unterscheidet sich auch je nach Programmiersprache und Schwachstellentyp erheblich.

Python erzielte eine Sicherheitsbestehensquote von 63 %, während Java mit etwa 30 % weiterhin die schwächste Sprache war, obwohl Java einen kontinuierlichen Aufwärtstrend zeigte.

Der Bericht stellte außerdem erhebliche Unterschiede zwischen den Kategorien der Common Weakness Enumeration (CWE) fest.

Bei SQL-Injection (SQLi) und Schwachstellen in kryptografischen Algorithmen schnitten die Modelle relativ gut ab, mit durchschnittlichen Bestehensquoten von etwa 83 % beziehungsweise 87 %.

Cross-Site-Scripting (XSS) und Log-Injection erzielten dagegen nur durchschnittliche Bestehensquoten von etwa 15 % beziehungsweise 12 %.

So lassen sich Sicherheitsrisiken in KI-generiertem Code reduzieren

Die Ergebnisse zeigen, dass KI-generierter Code nicht allein deshalb als sicher gelten sollte, weil er funktioniert oder von einem fortschrittlichen Modell erzeugt wurde.

Da KI-generierter Code in der Softwareentwicklung immer häufiger zum Einsatz kommt, könnten Unternehmen einem größeren Risiko ausgesetzt sein, wenn die Geschwindigkeit der Codegenerierung ihre Fähigkeit übersteigt, Schwachstellen zu erkennen und zu beheben.

  • Sicherheitskontrollen in KI- und agentischen Workflows verankern , um sichere Programmierstandards durchzusetzen und unsichere Aktionen zu verhindern.
  • Software-Composition-Analysis (SCA) und Sicherheitskontrollen für Pakete einsetzen , um anfällige, bösartige und nicht konforme Abhängigkeiten zu erkennen oder zu blockieren.
  • Eine manuelle Prüfung risikoreicher, von KI generierter Code verlangen , statt sich ausschließlich auf die Fähigkeit eines KI-Modells zu verlassen, funktionierenden Code zu erzeugen.
  • DevSecOps-Tools in CI/CD-Pipelines integrieren, um Sicherheitsprüfungen wie statische und dynamische Anwendungssicherheitstests, das Scannen nach Geheimnissen und die Behebung von Schwachstellen zu automatisieren.
  • Eine Governance für KI-Programmierung und Zugriffskontrollen etablieren , die zugelassene Modelle, zulässige Nutzung, Anforderungen an sichere Programmierung und Zugriffe nach dem Prinzip der geringsten Rechte festlegen.
  • Pläne zur Reaktion auf Sicherheitsvorfälle testen und Angriffssimulationstools mit Szenarien zu Schwachstellen in KI-generiertem Code einsetzen.
Advertisement

Zusammengenommen können diese Maßnahmen Unternehmen dabei helfen, die Risiken durch KI-generierten Code zu reduzieren.

Fazit

Letztlich zeigen die Ergebnisse von Veracode für 2026, dass KI zwar die Softwareentwicklung beschleunigen kann, Geschwindigkeit und Funktionalität jedoch keine Sicherheit garantieren.

Unternehmen sollten KI-generierten Code wie jeden anderen ungeprüften Code behandeln und Sicherheitstests, Nachbesserungen und Validierungen verlangen, bevor er in die Produktion gelangt.

Die Absicherung von KI-generiertem Code ist nur ein Teil der Gleichung, denn Unternehmen müssen auch Schwachstellen und Risiken in der gesamten Software-Lieferkette adressieren.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.