Eine Bewertung führender Large Language Models (LLMs) durch Cisco ergab, dass kein getestetes Modell mehrstufigen adversarialen Angriffen durchgängig widerstand, was Bedenken hinsichtlich der aktuellen Sicherheitsbewertungen von KI aufkommen lässt.
Die Forschung deutet darauf hin, dass viele weit verbreitete Sicherheits-Benchmarks für KI das Risiko in der Praxis möglicherweise unterschätzen, weil sie sich vor allem auf Eingabeaufforderungen in Einzelinteraktionen statt auf adaptive, iterative Angriffe konzentrieren.
Wichtigste Erkenntnisse aus der Cisco-Forschung
- Cisco stellte fest, dass jedes getestete führende LLM trotz teils guter Sicherheitsleistung bei Einzelinteraktionen weiterhin anfällig für mehrstufige Angriffe war.
- Die Erfolgsquoten mehrstufiger Angriffe lagen sowohl bei proprietären als auch bei KI-Modellen mit offenen Gewichtungen deutlich über den Ergebnissen von Einzelinteraktionen.
- Angreifer können Schutzmechanismen umgehen, indem sie Anfragen schrittweise umformulieren, Rollen annehmen und bösartige Eingabeaufforderungen über mehrere Interaktionen hinweg eskalieren.
- Öffentliche Sicherheits-Benchmarks und Model Cards für KI unterschätzen möglicherweise das Risiko in der Praxis, weil sie sich häufig nur auf Bewertungen mit Einzelinteraktionen konzentrieren.
- Forschende empfehlen Tests mit mehreren Interaktionen, Laufzeitüberwachung, Red-Teaming und externe Schutzmechanismen, um die Sicherheit und Governance von KI in Unternehmen zu verbessern.
Führende Modelle weisen eine hohe Anfälligkeit für mehrstufige Angriffe auf
Forschende bewerteten 15 proprietäre Flaggschiffmodelle von OpenAI, Anthropic, Google, Amazon und xAI anhand von Angriffsszenarien mit Einzel- und Mehrfachinteraktionen.
Die Ergebnisse zeigten, dass die Erfolgsquoten von Angriffen mit einer Einzelinteraktion (ASRs) zwischen 2,19 % und 64,91 % lagen, während die ASRs bei Mehrfachinteraktionen zwischen 7,89 % und 88,30 % lagen.
Die Forschenden kamen zu dem Schluss, dass Tests mit Einzelinteraktionen allein nicht genau widerspiegeln, wie sich Modelle verhalten, wenn Angreifer ihre Taktik über mehrere Interaktionen hinweg anpassen können.
Die Studie baut auf früheren Untersuchungen mit Modellen mit offenen Gewichtungen auf, bei denen die Erfolgsquoten mehrstufiger Angriffe zwei- bis zehnmal höher ausfielen als die Basiswerte für Einzelinteraktionen.
Dieses Muster zeigt sich sowohl bei offenen als auch bei proprietären führenden Modellen und deutet darauf hin, dass die Anfälligkeit für mehrstufige Angriffe eine umfassendere strukturelle Herausforderung der aktuellen LLM-Architekturen darstellt.
Mehrstufige Angriffe legen Sicherheitslücken bei KI offen
Forschende betonten, dass Tests mit mehreren Interaktionen das Verhalten von Angreifern in der Praxis genauer abbilden, weil Angreifer sich nur selten auf eine einzige bösartige Eingabeaufforderung verlassen.
Stattdessen formulieren Angreifer Anfragen häufig um, eskalieren schrittweise, nehmen Rollen an oder teilen bösartige Ziele auf mehrere Interaktionen auf, um Schutzmechanismen zu umgehen.
Der Bericht stellte bei den getesteten Modellen erhebliche Unterschiede zwischen der Leistung bei Einzel- und Mehrfachinteraktionen fest.
OpenAIs GPT-5.4 stieg von einer ASR von 2,74 % bei Einzelinteraktionen auf 24,68 % unter Bedingungen mit Mehrfachinteraktionen, während Googles Gemini 3 Pro von 18,10 % auf 73,35 % stieg.
Die Claude-Modelle von Anthropic, die bei Einzelinteraktionen einige der höchsten Ablehnungsquoten zeigten, erreichten bei Mehrfachinteraktionen dennoch ASRs zwischen 11,16 % und 16,20 %.
xAIs Grok 4.1 Fast verzeichnete im Modus ohne Schlussfolgerungen mit 88,30 % die höchste beobachtete ASR bei Mehrfachinteraktionen.
Die Forschenden stellten zudem erhebliche Unterschiede im Zusammenhang mit den Bereitstellungskonfigurationen fest.
Grok 4.1 Fast zeigte eine bemerkenswerte Verringerung der ASR bei Mehrfachinteraktionen, wenn der Schlussfolgerungsmodus aktiviert war: Unter denselben Testbedingungen sank sie von 88,30 % auf 43,47 %.
Der Bericht stellte fest, dass Sicherheitsunterschiede aufgrund von Konfigurationseinstellungen, Schlussfolgerungsmodi oder Optionen für Schutzmechanismen in öffentlichen Benchmarks oder Model Cards üblicherweise nicht berücksichtigt werden.
Angriffsstrategien und Risiken für Unternehmen
Der Bericht ordnete die adversarialen Taktiken mehreren Strategiefamilien zu, darunter Rollenspiele und die Annahme von Rollen, kontextuelle Mehrdeutigkeit, die Umformulierung von Ablehnungen, die Zerlegung von Informationen und Techniken zur schrittweisen Eskalation.
Die Forschenden stellten fest, dass die Leistung in diesen Angriffskategorien variierte – selbst bei Modellen mit vergleichsweise niedrigen aggregierten ASRs.
Schwachstellen bei Einzelinteraktionen konzentrierten sich ebenfalls auf mehrere wiederkehrende Verfahren, darunter Techniken mit einer sich als KI ausgebenden Identität, sanftes Paraphrasieren und die Manipulation von System-Prompts.
Diese Angriffsmuster führten durchgängig zu höheren ASRs als viele andere Kategorien von Eingabeaufforderungen und könnten als vorrangige Bereiche für defensive Verbesserungen dienen.
Die Ergebnisse haben weiterreichende Auswirkungen auf Organisationen, die KI-Systeme in Unternehmensumgebungen einsetzen.
Die Forschenden warnten, dass eine ausschließliche Orientierung an öffentlich verfügbaren Benchmark-Werten für Einzelinteraktionen Governance- und Beschaffungsrisiken schaffen könnte, weil sich Modelle mit ähnlichen Sicherheitswerten in iterativen Angriffen sehr unterschiedlich verhalten können.
Sicherheitstests und Governance für KI stärken
Der Bericht steht im Einklang mit breiteren regulatorischen Diskussionen über adversariales Testen von KI und die Robustheit von Modellen.
Rahmenwerke wie das NIST AI Risk Management Framework, das künftige NIST Cyber AI Profile und der European Union AI Act verweisen allesamt auf Tests zur Robustheit gegenüber adversarialen Angriffen.
Allerdings ist anzumerken, dass viele dieser Rahmenwerke derzeit noch keine detaillierten Leitlinien für Methoden zur Bewertung von Mehrfachinteraktionen enthalten.
Die Forschenden empfahlen Tests in gepaarten Regimen für Angriffe mit Einzel- und Mehrfachinteraktionen, die Veröffentlichung strategiespezifischer ASRs sowie die Überprüfung von Modellen mit großen Leistungsunterschieden zwischen den Regimen.
Der Bericht regte außerdem an, dass Unternehmen sich zunehmend auf Laufzeitüberwachung, Red-Teaming, Schutzmaßnahmen auf Anwendungsebene und externe Schutzmechanismen konzentrieren, statt sich ausschließlich auf Sicherheitsversprechen auf Modellebene zu verlassen.
Die Ergebnisse zeigen, dass Tests zur Resilienz von KI über statische Benchmarks hinausgehen müssen, um das Verhalten realer Angreifer bei Mehrfachinteraktionen besser abzubilden.

