Generative künstliche Intelligenz (GenAI) hat die Softwareentwicklung rasch verändert, indem sie Entwicklern ermöglicht, funktionierenden Code schneller und in größerem Umfang zu generieren.
Der Veracode-Bericht zur Code-Sicherheit von GenAI 2026 offenbart jedoch eine Diskrepanz zwischen den Fortschritten bei den Programmierfähigkeiten von KI und den Verbesserungen bei der Sicherheit.
Obwohl moderne Large Language Models (LLMs) nahezu perfekt syntaktisch korrekten Code erzeugen können, hat sich ihre Fähigkeit, sicheren Code zu erzeugen, im vergangenen Jahr kaum verbessert.
Diese Erkenntnis deutet darauf hin, dass Unternehmen, die eine KI-gestützte Entwicklung einsetzen, generierten Code als nicht vertrauenswürdig behandeln müssen, bis er geeigneten Sicherheitstests unterzogen wurde.
- Die wichtigsten Erkenntnisse des Veracode-Berichts
- Die Ergebnisse der Veracode-Studie zur KI-Code-Sicherheit 2026 auf einen Blick
- Die Sicherheit von KI-generiertem Code stagniert laut Veracode bei 56 %
- Größere KI-Modelle garantieren keinen sichereren Code
- So lassen sich Sicherheitsrisiken in KI-generiertem Code reduzieren
- Fazit
Die wichtigsten Erkenntnisse des Veracode-Berichts
- Die Sicherheit von KI-generiertem Code stagniert weitgehend, wobei Veracode trotz nahezu perfekter Syntaxleistung eine durchschnittliche Sicherheitsbestehensquote von etwa 56 % meldet.
- Fortschrittlichere KI-Modelle sind nicht zwangsläufig sicherer, da auf Programmierung spezialisierte Modelle ähnlich abschnitten wie Allzweckmodelle und größere Modelle nur einen geringen Sicherheitsvorteil zeigten.
- Die Sicherheitsleistung variiert je nach KI-Modell erheblich, wobei GPT-5.5 mit 68 % führend war, während sechs der 11 getesteten Modelle zwischen 50 % und 53 % erzielten.
- Programmiersprache und Schwachstellentyp beeinflussen die Sicherheit von KI-Code, wobei Python besser abschnitt als Java und die Ergebnisse je nach Schwachstellenkategorie stark variierten.
- KI-generierter Code erfordert weiterhin Sicherheitstests und Nachbesserungen, bevor Unternehmen ihn in Produktionsumgebungen einsetzen.
Die Ergebnisse der Veracode-Studie zur KI-Code-Sicherheit 2026 auf einen Blick
| Ergebnis | Ergebnis 2026 | Bedeutung |
|---|---|---|
| Gesamte Sicherheitsbestehensquote von KI-Code | 56% | Bei fast 44 % der Sicherheitstests für Code wurde ein Fehler festgestellt |
| Syntax-Bestehensquote | ~100% | Funktionierender Code ist nicht zwangsläufig sicherer Code |
| Leistungsstärkstes Modell | GPT-5.5: 68 % | Selbst der Spitzenreiter scheiterte bei fast einem Drittel der Sicherheitsaufgaben |
| Programmiermodelle im Vergleich zu Allzweckmodellen | 51 % gegenüber 52 % | Die Spezialisierung auf Programmierung brachte keinen Sicherheitsvorteil |
| Große, mittlere und kleine Modelle im Vergleich | 53% / 51% / 51% | Eine größere Modellgröße verbesserte die Sicherheit nicht wesentlich |
| Modelle mit und ohne Schlussfolgerungen im Vergleich | 56 % gegenüber 51 % | Modelle mit Schlussfolgerungsfähigkeit zeigten einen moderaten Sicherheitsvorteil |
| Python im Vergleich zu Java | 63 % gegenüber 30 % | Die Sicherheitsleistung variierte je nach Sprache erheblich |
Die Sicherheit von KI-generiertem Code stagniert laut Veracode bei 56 %
Veracode bewertete in vier Testrunden mehr als 100 KI-Modelle anhand standardisierter Aufgaben zur Codegenerierung, die mehrere Programmiersprachen und Schwachstellenkategorien umfassten.
Der Bericht ergab, dass die durchschnittliche Sicherheitsbestehensquote 2026 bei etwa 56 % lag.
Bei rund 44 % der Aufgaben zur Codegenerierung entstand Code mit einer erkennbaren Schwachstelle aus den OWASP Top 10.
Zum Vergleich: Die Modelle erzeugten kompilierbaren Code mit einer Syntax-Bestehensquote von nahezu 100 %.
Funktionierender, von KI generierter Code ist nicht immer sicher
Die Lücke verdeutlicht einen wichtigen Unterschied zwischen funktionierender und sicherer Software: Code, der kompiliert und erwartungsgemäß funktioniert, ist nicht zwangsläufig sicher für den Einsatz.
Die Ergebnisse von Veracode zeigen, dass LLMs zwar die Syntax nahezu gemeistert haben, ihre Sicherheitsleistung über die jüngsten Modellgenerationen hinweg jedoch relativ unverändert geblieben ist.
Die Sicherheit von KI-Code variiert je nach Modell
Auch die Leistung einzelner Modelle variiert beträchtlich.
OpenAIs GPT-5.5 erzielte in der Veracode-Rangliste für den Sommer 2026 mit 68 % die höchste Sicherheitsbestehensquote, gefolgt von GPT-5.3-Codex und Anthropics Claude-Opus-4.8 mit jeweils 62 %.
Sechs der 11 für die Rangliste bewerteten Modelle erzielten jedoch zwischen 50 % und 53 %.
Größere KI-Modelle garantieren keinen sichereren Code
Eine wichtige Erkenntnis lautet, dass speziell für die Programmierung entwickelte Modelle nicht zwangsläufig sicherer sind.
Auf Programmierung spezialisierte Modelle erzielten eine durchschnittliche Sicherheitsbestehensquote von 51 %, verglichen mit 52 % bei Allzweckmodellen.
Dies deutet darauf hin, dass die Optimierung eines KI-Systems für eine effiziente Codegenerierung nicht automatisch seine Fähigkeit verbessert, Sicherheitslücken zu erkennen oder zu vermeiden.
Schlussfolgerungsfähigkeit ist für die Sicherheit wichtiger als die Größe des KI-Modells
Auch eine Vergrößerung des Modells bringt nur einen geringen Sicherheitsvorteil.
Große Modelle mit mehr als 100 Milliarden Parametern erzielten eine durchschnittliche Sicherheitsbestehensquote von 53 %, während mittlere und kleine Modelle jeweils auf etwa 51 % kamen.
Modelle mit Schlussfolgerungsfähigkeit schnitten etwas besser ab und erzielten durchschnittlich 56 %, verglichen mit 51 % bei Modellen ohne diese Fähigkeit.
Veracode zufolge kann der zusätzliche Schlussfolgerungsprozess ähnlich wie eine interne Codeprüfung wirken.
Die Sicherheit von KI-Code variiert je nach Programmiersprache
Die Sicherheitsleistung unterscheidet sich auch je nach Programmiersprache und Schwachstellentyp erheblich.
Python erzielte eine Sicherheitsbestehensquote von 63 %, während Java mit etwa 30 % weiterhin die schwächste Sprache war, obwohl Java einen kontinuierlichen Aufwärtstrend zeigte.
Der Bericht stellte außerdem erhebliche Unterschiede zwischen den Kategorien der Common Weakness Enumeration (CWE) fest.
Bei SQL-Injection (SQLi) und Schwachstellen in kryptografischen Algorithmen schnitten die Modelle relativ gut ab, mit durchschnittlichen Bestehensquoten von etwa 83 % beziehungsweise 87 %.
Cross-Site-Scripting (XSS) und Log-Injection erzielten dagegen nur durchschnittliche Bestehensquoten von etwa 15 % beziehungsweise 12 %.
So lassen sich Sicherheitsrisiken in KI-generiertem Code reduzieren
Die Ergebnisse zeigen, dass KI-generierter Code nicht allein deshalb als sicher gelten sollte, weil er funktioniert oder von einem fortschrittlichen Modell erzeugt wurde.
Da KI-generierter Code in der Softwareentwicklung immer häufiger zum Einsatz kommt, könnten Unternehmen einem größeren Risiko ausgesetzt sein, wenn die Geschwindigkeit der Codegenerierung ihre Fähigkeit übersteigt, Schwachstellen zu erkennen und zu beheben.
- Sicherheitskontrollen in KI- und agentischen Workflows verankern , um sichere Programmierstandards durchzusetzen und unsichere Aktionen zu verhindern.
- Software-Composition-Analysis (SCA) und Sicherheitskontrollen für Pakete einsetzen , um anfällige, bösartige und nicht konforme Abhängigkeiten zu erkennen oder zu blockieren.
- Eine manuelle Prüfung risikoreicher, von KI generierter Code verlangen , statt sich ausschließlich auf die Fähigkeit eines KI-Modells zu verlassen, funktionierenden Code zu erzeugen.
- DevSecOps-Tools in CI/CD-Pipelines integrieren, um Sicherheitsprüfungen wie statische und dynamische Anwendungssicherheitstests, das Scannen nach Geheimnissen und die Behebung von Schwachstellen zu automatisieren.
- Eine Governance für KI-Programmierung und Zugriffskontrollen etablieren , die zugelassene Modelle, zulässige Nutzung, Anforderungen an sichere Programmierung und Zugriffe nach dem Prinzip der geringsten Rechte festlegen.
- Pläne zur Reaktion auf Sicherheitsvorfälle testen und Angriffssimulationstools mit Szenarien zu Schwachstellen in KI-generiertem Code einsetzen.
Zusammengenommen können diese Maßnahmen Unternehmen dabei helfen, die Risiken durch KI-generierten Code zu reduzieren.
Fazit
Letztlich zeigen die Ergebnisse von Veracode für 2026, dass KI zwar die Softwareentwicklung beschleunigen kann, Geschwindigkeit und Funktionalität jedoch keine Sicherheit garantieren.
Unternehmen sollten KI-generierten Code wie jeden anderen ungeprüften Code behandeln und Sicherheitstests, Nachbesserungen und Validierungen verlangen, bevor er in die Produktion gelangt.
Die Absicherung von KI-generiertem Code ist nur ein Teil der Gleichung, denn Unternehmen müssen auch Schwachstellen und Risiken in der gesamten Software-Lieferkette adressieren.





