Mehrstufige Angriffe legen anhaltende Schwachstellen bei führenden KI-Modellen offen

Eine Studie von Cisco ergab, dass führende KI-Modelle weiterhin anfällig für mehrstufige Angriffe sind.

Verfasst von
Ken Underhill
Ken Underhill
May 28, 2026
4 minute read
eSecurity Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Eine Bewertung führender Large Language Models (LLMs) durch Cisco ergab, dass kein getestetes Modell mehrstufigen adversarialen Angriffen durchgängig widerstand, was Bedenken hinsichtlich der aktuellen Sicherheitsbewertungen von KI aufkommen lässt. 

Die Forschung deutet darauf hin, dass viele weit verbreitete Sicherheits-Benchmarks für KI das Risiko in der Praxis möglicherweise unterschätzen, weil sie sich vor allem auf Eingabeaufforderungen in Einzelinteraktionen statt auf adaptive, iterative Angriffe konzentrieren.

Wichtigste Erkenntnisse aus der Cisco-Forschung

  • Cisco stellte fest, dass jedes getestete führende LLM trotz teils guter Sicherheitsleistung bei Einzelinteraktionen weiterhin anfällig für mehrstufige Angriffe war.
  • Die Erfolgsquoten mehrstufiger Angriffe lagen sowohl bei proprietären als auch bei KI-Modellen mit offenen Gewichtungen deutlich über den Ergebnissen von Einzelinteraktionen.
  • Angreifer können Schutzmechanismen umgehen, indem sie Anfragen schrittweise umformulieren, Rollen annehmen und bösartige Eingabeaufforderungen über mehrere Interaktionen hinweg eskalieren.
  • Öffentliche Sicherheits-Benchmarks und Model Cards für KI unterschätzen möglicherweise das Risiko in der Praxis, weil sie sich häufig nur auf Bewertungen mit Einzelinteraktionen konzentrieren.
  • Forschende empfehlen Tests mit mehreren Interaktionen, Laufzeitüberwachung, Red-Teaming und externe Schutzmechanismen, um die Sicherheit und Governance von KI in Unternehmen zu verbessern.

Führende Modelle weisen eine hohe Anfälligkeit für mehrstufige Angriffe auf

Forschende bewerteten 15 proprietäre Flaggschiffmodelle von OpenAI, Anthropic, Google, Amazon und xAI anhand von Angriffsszenarien mit Einzel- und Mehrfachinteraktionen. 

Die Ergebnisse zeigten, dass die Erfolgsquoten von Angriffen mit einer Einzelinteraktion (ASRs) zwischen 2,19 % und 64,91 % lagen, während die ASRs bei Mehrfachinteraktionen zwischen 7,89 % und 88,30 % lagen. 

Die Forschenden kamen zu dem Schluss, dass Tests mit Einzelinteraktionen allein nicht genau widerspiegeln, wie sich Modelle verhalten, wenn Angreifer ihre Taktik über mehrere Interaktionen hinweg anpassen können.

Die Studie baut auf früheren Untersuchungen mit Modellen mit offenen Gewichtungen auf, bei denen die Erfolgsquoten mehrstufiger Angriffe zwei- bis zehnmal höher ausfielen als die Basiswerte für Einzelinteraktionen. 

Dieses Muster zeigt sich sowohl bei offenen als auch bei proprietären führenden Modellen und deutet darauf hin, dass die Anfälligkeit für mehrstufige Angriffe eine umfassendere strukturelle Herausforderung der aktuellen LLM-Architekturen darstellt.  

Advertisement

Mehrstufige Angriffe legen Sicherheitslücken bei KI offen

Forschende betonten, dass Tests mit mehreren Interaktionen das Verhalten von Angreifern in der Praxis genauer abbilden, weil Angreifer sich nur selten auf eine einzige bösartige Eingabeaufforderung verlassen. 

Stattdessen formulieren Angreifer Anfragen häufig um, eskalieren schrittweise, nehmen Rollen an oder teilen bösartige Ziele auf mehrere Interaktionen auf, um Schutzmechanismen zu umgehen.

Der Bericht stellte bei den getesteten Modellen erhebliche Unterschiede zwischen der Leistung bei Einzel- und Mehrfachinteraktionen fest. 

OpenAIs GPT-5.4 stieg von einer ASR von 2,74 % bei Einzelinteraktionen auf 24,68 % unter Bedingungen mit Mehrfachinteraktionen, während Googles Gemini 3 Pro von 18,10 % auf 73,35 % stieg. 

Die Claude-Modelle von Anthropic, die bei Einzelinteraktionen einige der höchsten Ablehnungsquoten zeigten, erreichten bei Mehrfachinteraktionen dennoch ASRs zwischen 11,16 % und 16,20 %. 

xAIs Grok 4.1 Fast verzeichnete im Modus ohne Schlussfolgerungen mit 88,30 % die höchste beobachtete ASR bei Mehrfachinteraktionen.

Die Forschenden stellten zudem erhebliche Unterschiede im Zusammenhang mit den Bereitstellungskonfigurationen fest. 

Grok 4.1 Fast zeigte eine bemerkenswerte Verringerung der ASR bei Mehrfachinteraktionen, wenn der Schlussfolgerungsmodus aktiviert war: Unter denselben Testbedingungen sank sie von 88,30 % auf 43,47 %. 

Der Bericht stellte fest, dass Sicherheitsunterschiede aufgrund von Konfigurationseinstellungen, Schlussfolgerungsmodi oder Optionen für Schutzmechanismen in öffentlichen Benchmarks oder Model Cards üblicherweise nicht berücksichtigt werden.

Angriffsstrategien und Risiken für Unternehmen

Der Bericht ordnete die adversarialen Taktiken mehreren Strategiefamilien zu, darunter Rollenspiele und die Annahme von Rollen, kontextuelle Mehrdeutigkeit, die Umformulierung von Ablehnungen, die Zerlegung von Informationen und Techniken zur schrittweisen Eskalation. 

Die Forschenden stellten fest, dass die Leistung in diesen Angriffskategorien variierte – selbst bei Modellen mit vergleichsweise niedrigen aggregierten ASRs.

Advertisement

Schwachstellen bei Einzelinteraktionen konzentrierten sich ebenfalls auf mehrere wiederkehrende Verfahren, darunter Techniken mit einer sich als KI ausgebenden Identität, sanftes Paraphrasieren und die Manipulation von System-Prompts. 

Diese Angriffsmuster führten durchgängig zu höheren ASRs als viele andere Kategorien von Eingabeaufforderungen und könnten als vorrangige Bereiche für defensive Verbesserungen dienen.

Die Ergebnisse haben weiterreichende Auswirkungen auf Organisationen, die KI-Systeme in Unternehmensumgebungen einsetzen. 

Die Forschenden warnten, dass eine ausschließliche Orientierung an öffentlich verfügbaren Benchmark-Werten für Einzelinteraktionen Governance- und Beschaffungsrisiken schaffen könnte, weil sich Modelle mit ähnlichen Sicherheitswerten in iterativen Angriffen sehr unterschiedlich verhalten können.

Sicherheitstests und Governance für KI stärken

Der Bericht steht im Einklang mit breiteren regulatorischen Diskussionen über adversariales Testen von KI und die Robustheit von Modellen. 

Rahmenwerke wie das NIST AI Risk Management Framework, das künftige NIST Cyber AI Profile und der European Union AI Act verweisen allesamt auf Tests zur Robustheit gegenüber adversarialen Angriffen. 

Allerdings ist anzumerken, dass viele dieser Rahmenwerke derzeit noch keine detaillierten Leitlinien für Methoden zur Bewertung von Mehrfachinteraktionen enthalten. 

Die Forschenden empfahlen Tests in gepaarten Regimen für Angriffe mit Einzel- und Mehrfachinteraktionen, die Veröffentlichung strategiespezifischer ASRs sowie die Überprüfung von Modellen mit großen Leistungsunterschieden zwischen den Regimen.  

Der Bericht regte außerdem an, dass Unternehmen sich zunehmend auf Laufzeitüberwachung, Red-Teaming, Schutzmaßnahmen auf Anwendungsebene und externe Schutzmechanismen konzentrieren, statt sich ausschließlich auf Sicherheitsversprechen auf Modellebene zu verlassen.

Advertisement

Die Ergebnisse zeigen, dass Tests zur Resilienz von KI über statische Benchmarks hinausgehen müssen, um das Verhalten realer Angreifer bei Mehrfachinteraktionen besser abzubilden. 

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.