BSides 2026: Wie KI-Agenten in der offensiven Sicherheit wirklich abschneiden

Die BSides-2026-Forschung zeigt: Das Verhalten von KI-Agenten verrät mehr als Benchmark-Ergebnisse.

Verfasst von
Ken Underhill
Ken Underhill
Aug 3, 2026
4 minute read
eSecurity Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Die Cybersicherheitsfähigkeiten großer Sprachmodelle (LLMs) werden häufig anhand eines einzigen Benchmark-Werts zusammengefasst. 

Neue Forschung die auf der BSides-2026-Konferenz vorgestellt wurde, legt jedoch nahe, dass diese Werte nur wenig darüber aussagen, wie sich KI-Agenten bei Aufgaben der offensiven Sicherheit tatsächlich verhalten. 

Anstatt sich ausschließlich auf die Lösungsquoten im Benchmark zu konzentrieren, analysierte der Forscher Tarun Koyalwar die Entscheidungsprozesse von KI-Agenten bei Aufgaben der offensiven Sicherheit. 

Seine Forschung untersuchte, was die Modelle wissen, wie sie Angriffe durchdenken, woran sie scheitern und was dieses Verhalten über künftige Bewertungen der Cybersicherheit aussagt. 

Zentrale Erkenntnisse der LLM-Benchmarkforschung

  • Herkömmliche Benchmark-Werte sagen nur wenig darüber aus, wie KI-Agenten Aufgaben der offensiven Sicherheit tatsächlich bewältigen.
  • Viele Fehler von LLMs sind eher auf Ausführungslücken als auf fehlendes Wissen über Cybersicherheit zurückzuführen.
  • Führende Open-Weight-Modelle schnitten unter identischen Testbedingungen fast ebenso gut ab wie führende Modelle mit geschlossenen Gewichten.
  • KI-Agenten stützten sich stärker auf Mustererkennung als auf traditionelle Penetrationstestmethoden.
  • Verhaltens-Telemetrie liefert tiefere Einblicke in die Sicherheitsrisiken von KI als Benchmark-Werte allein.

Benchmark-Werte erfassen nicht das Gesamtbild

Koyalwars Forschung bewertete sowohl LLMs mit offenen als auch solche mit geschlossenen Gewichten anhand einer modifizierten Version des Argus-Validierungsbenchmarks, der aus 54 nutzbaren Black-Box-Zielen für Webanwendungen bestand. 

Jedes Modell erhielt lediglich einen knappen Prompt mit der Aufforderung, eine Zielanwendung anzugreifen – ohne Quellcode oder Implementierungsdetails. 

Statt nur zu messen, ob ein Modell eine Herausforderung erfolgreich bewältigte, untersuchte die Forschung jeden einzelnen Schritt, den die Modelle während des gesamten Angriffsprozesses ausführten.

Die Ergebnisse legen nahe, dass herkömmliche Cybersicherheits-Benchmarks die Fähigkeiten von KI zu stark vereinfachen. 

Ein erfolgreicher Exploit zeigt nicht, ob das Modell die Schwachstelle durch systematische Tests, Mustererkennung oder einen unbeabsichtigten Angriffspfad gefunden hat. 

Ebenso offenbaren fehlgeschlagene Versuche häufig Modelle, die zwar die richtige Angriffstechnik verstanden hatten, sie aber nicht erfolgreich ausführen konnten.

Advertisement

KI weiß mehr, als sie ausführen kann

Eine der bemerkenswertesten Erkenntnisse der Studie ist, dass viele Fehler von LLMs nicht durch fehlendes Wissen über Cybersicherheit verursacht werden. 

Stattdessen identifizierten die Modelle häufig die richtige Schwachstelle, verwiesen auf die passende Exploit-Technik oder nannten sogar die relevante CVE-Kennung, bevor sie den Angriff nicht zu Ende bringen konnten.

Zu den Beispielen gehörten Modelle, die wiederholt die richtige Angriffskette erkannten, dann aber kleine Ausführungsfehler machten – etwa fehlerhaft formatierte Anfragen abschickten oder trotz der zuvor in der Sitzung identifizierten richtigen Adresse wiederholt den falschen Host anvisierten. 

Laut Koyalwar verdeutlicht dies die erhebliche Lücke zwischen dem Wissen darüber, was zu tun ist, und der erfolgreichen Ausführung der erforderlichen Aktionen.

Die Forschung weist außerdem darauf hin, dass aktuelle Benchmark-Werte nicht zwischen echten Fähigkeitsgrenzen und dem unterscheiden können, was Forschende als „Elicitations-Lücke“ bezeichnen: Das Modell verfügt zwar über die Fähigkeit, kann sie in einem bestimmten Durchlauf aber nicht demonstrieren.

Offene Modelle verringern den Leistungsabstand

Eine weitere Beobachtung ist, wie gut führende Open-Weight-Modelle im Vergleich zu Spitzenmodellen mit geschlossenen Gewichten abschnitten. 

Unter identischen Testbedingungen bewältigte die Gruppe der offenen Modelle 52 der 54 Benchmark-Ziele erfolgreich, während die Gruppe der geschlossenen Modelle 48 erreichte.

Der stärkste Einzelperformer unter den offenen Modellen war Kimi K3, wobei mehrere offene Modelle gemeinsam die höchste Gesamtabdeckung erzielten. 

Auch die Kosten erwiesen sich als unzuverlässiger Leistungsindikator. 

Der Forschung zufolge unterschieden sich die Ausführungskosten um fast zwei Größenordnungen; weder eine offene noch eine geschlossene Lizenzierung sagte die Betriebskosten zuverlässig voraus.

Advertisement

KI-Agenten denken nicht wie menschliche Pentester

Anstatt traditionellen Penetrationstestmethoden zu folgen, die Aufklärung, Enumeration und Exploitation betonen, stützten sich viele Modelle stark auf das Erkennen von Schwachstellenmustern. 

Die Forschung ergab, dass Modelle häufig unmittelbar nach der Beobachtung des Anwendungsverhaltens wahrscheinliche Schwachstellen vermuteten – und damit oft richtig lagen.

Dieser Ansatz der Mustererkennung ermöglichte es den Modellen in vielen Fällen, effizienter zu erfolgreichen Ergebnissen zu gelangen als mit einer strukturierten Methodik nach menschlichem Vorbild. 

Koyalwar zufolge scheint dieses Verhalten ganz natürlich aus der umfassenden Auseinandersetzung mit öffentlich verfügbarem Wissen über Cybersicherheit hervorzugehen und nicht aus einer expliziten Ausbildung in offensiver Sicherheit.

Verhaltensanalysen verbessern die Risikobewertung von KI

Die Studie identifizierte außerdem Fälle, in denen Modelle mit Komponenten der Testumgebung statt mit der vorgesehenen Zielanwendung interagierten. 

Der Forschung zufolge traten diese Verhaltensweisen typischerweise auf, wenn die Modelle die unterstützende Infrastruktur als Teil der Herausforderung betrachteten, anstatt gezielt zu versuchen, die Begrenzung zu umgehen.

Noch wichtiger ist, dass die Modelle häufig nicht erkannten oder meldeten, wenn sie über unbeabsichtigte Seitenkanäle erfolgreich waren – etwa durch offengelegte Zugangsdaten oder Benchmark-Artefakte. 

Herkömmliche Bewertungsmethoden verbuchten diese Fälle als erfolgreiche Exploits, obwohl sie nicht die beabsichtigte offensive Fähigkeit demonstrierten.

Für Sicherheitsteams, die KI-gestützte Tools für offensive Sicherheit bewerten, legen die Ergebnisse nahe, dass Verhaltens-Telemetrie aussagekräftigere Erkenntnisse liefern kann als reine Benchmark-Prozentwerte. 

Advertisement

Da Unternehmen autonome KI für offensive Sicherheit einsetzen, wird es immer wichtiger zu verstehen, wie Agenten schlussfolgern und woran sie scheitern. 

Die zunehmende Autonomie von KI zwingt Unternehmen dazu, die Vertrauensmodelle, die das Verhalten von Agenten steuern, neu zu bewerten. 

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.