KI-Agenten-Harnesses können Ergebnisse von Red-Teamings verändern

Untersuchungen von Lasso zeigen, dass KI-Agenten-Harnesses die Leistung beim Red-Teaming ebenso stark beeinflussen können wie das zugrunde liegende LLM.

Written By
Ken Underhill
Ken Underhill
Aug 3, 2026
4 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Wenn Unternehmen KI-Agenten bewerten, vergleichen sie typischerweise Large Language Models (LLMs). 

Neue Untersuchungen von Lasso legen jedoch nahe, dass eine weitere Komponente ebenso viel Aufmerksamkeit verdient: das Agenten-Harness.

In ihrer Studie, in der sie Anthropic’s Claude Agent SDK mit dem auf LangGraph aufbauenden Open-Source-Framework deepagents verglichen, hielten die Forschenden das Modell, den Prompt, die Tools und die Angriffziele konstant und veränderten nur die Laufzeitumgebung. 

Die Ergebnisse zeigten, dass sich dasselbe Modell je nach dem Harness, das seine Ausführung steuerte, dramatisch unterschiedlich verhalten konnte.

Wichtigste Erkenntnisse

  • KI-Agenten-Harnesses können die Leistung in der offensiven Sicherheit bei Verwendung desselben zugrunde liegenden Modells beeinflussen.
  • Die Laufzeitarchitektur wirkte sich bei mehreren frontier-LLMs auf Erfolgsquoten von Angriffen, Zuverlässigkeit und Tool-Ausführung aus.
  • KI-Benchmarks messen möglicherweise die kombinierte Leistung von Modell und Harness statt nur die des Modells.
  • Die Forschenden stellten fest, dass autonome KI-Agenten fehlgeschlagene Angriffe häufig fälschlicherweise als erfolgreich einstuften, was den Bedarf an unabhängiger Validierung unterstreicht.
  • Die Auswahl des richtigen KI-Harnesses wird für Unternehmenseinsätze ebenso wichtig wie die Wahl des zugrunde liegenden LLMs.

Harnesses können den Erfolg von Angriffen beeinflussen

Ein KI-Agent besteht aus mehr als nur einem LLM. 

Laut den Forschenden umfasst ein Agent außerdem seinen Prompt, verfügbare Tools und das Harness, das für die Orchestrierung der Ausführung zuständig ist. 

Dieses Harness verwaltet Kontext, Tool-Aufrufe, Speicher, Planung und Ausführungsschleifen und prägt damit maßgeblich, wie sich das Modell während einer mehrstufigen Aufgabe verhält.

Um die Auswirkungen des Harnesses zu messen, testeten die Forschenden fünf Frontier-Modelle in 20 Angriffsszenarien aus den Bereichen Finanzen, Gesundheitswesen, Recht, Kundenbetreuung und Bildung. 

Die Modelle versuchten, Prompts zu extrahieren, vertrauliche Informationen offenzulegen und schädliche Inhalte gegen simulierte Anwendungen zu erzeugen.

Bei 1.000 autonomen Angriffen lagen die durchschnittlichen Erfolgsquoten der beiden Harnesses scheinbar relativ nah beieinander. 

Diese Durchschnittswerte verbargen jedoch erhebliche Unterschiede auf Ebene der einzelnen Modelle. 

Advertisement

In vielen Fällen schloss ein Harness Angriffe erfolgreich ab, an denen das andere trotz Verwendung desselben zugrunde liegenden Modells vollständig scheiterte.

Die Leistung variierte stark zwischen den Modellen

Die Studie ergab, dass die Auswahl des Harnesses bei einigen Modellen deutlich wichtiger war als bei anderen.

Claude Sonnet 5 erzielte unabhängig vom Harness nahezu identische Erfolgsquoten bei Angriffen, was darauf hindeutet, dass die Laufzeit nur wenig Einfluss auf sein Verhalten hatte. 

DeepSeek-V4-Pro erreichte über beide Frameworks hinweg einen ähnlich hohen Gesamterfolg, doch jedes Harness war in unterschiedlichen Angriffskategorien besonders leistungsfähig. 

Das eine war bei der Extraktion von System-Prompts deutlich besser, während das andere bei Angriffen zur Erzeugung schädlicher Inhalte höhere Erfolgsquoten erzielte.

Das dramatischste Ergebnis betraf Kimi-K2.6. 

Bei der Ausführung unter dem Claude Agent SDK erzielte das Modell eine Angriffserfolgsquote von etwa 1 %. 

Bei Verwendung von deepagents stieg dieser Wert auf ungefähr 24 %, ohne dass Modell, Prompt oder Tools geändert wurden. 

Die Forschenden führten den Unterschied auf die Protokollübersetzung zwischen Harness und Modell zurück, durch die die Tool-Ausführung unterbrochen und viele Angriffsabläufe vorzeitig beendet wurden.

Warum Harnesses die Bewertung der KI-Sicherheit beeinflussen

Die Ergebnisse haben Auswirkungen, die über Tests zur offensiven Sicherheit hinausgehen.

Unternehmen führen zunehmend Benchmarks von KI-Modellen durch, um autonome Fähigkeiten zu bewerten. Die Untersuchung legt jedoch nahe, dass diese Benchmarks häufig eine Kombination aus Modell und Harness statt nur das Modell messen. 

Unterschiedliche Harnesses verpacken Prompts auf unterschiedliche Weise, strukturieren Tool-Beschreibungen unterschiedlich und verwalten Ausführungsschleifen auf jeweils eigene Art – wodurch sowohl die Fähigkeiten als auch die Zuverlässigkeit beeinflusst werden können.

Die Forschenden stellten außerdem fest, dass die Bewertung der eigenen Leistung durch autonome Agenten zu irreführenden Ergebnissen führte. 

Mehr als die Hälfte der Angriffe, die Agenten als erfolgreich einstuften, wurden später durch einen unabhängigen Bewertungsprozess als Fehlschläge ermittelt. Das legt nahe, dass Unternehmen bei der Bewertung der Leistung autonomer Agenten auf eine externe Validierung zurückgreifen sollten.

Advertisement

Die Wahl des richtigen Harnesses hängt von der Arbeitslast ab

Die Studie kommt nicht zu dem Schluss, dass ein Harness grundsätzlich überlegen ist.

Das Claude Agent SDK bot in Kombination mit Anthropic-Modellen dank nativer Integration und Prompt-Caching Kostenvorteile, während deepagents eine größere Flexibilität über mehrere Modellanbieter hinweg bot. 

Die Forschenden betonten, dass Unternehmen das Harness zusammen mit dem Modell bewerten sollten, statt davon auszugehen, dass Laufzeitumgebungen austauschbar sind.

Für Unternehmen, die KI-Agenten einsetzen oder autonomes Red-Teaming durchführen, deutet diese Untersuchung darauf hin, dass die Laufzeitarchitektur sowohl die Ergebnisse von Sicherheitstests als auch die operative Leistung erheblich beeinflussen kann. 

Je leistungsfähiger KI-Agenten werden, desto wichtiger könnte die Auswahl des richtigen Harnesses sein – genauso wichtig wie die Auswahl des zugrunde liegenden Modells selbst.

Diese Erkenntnisse unterstreichen, dass der Einsatz von KI-Agenten nicht mehr nur eine technische Entscheidung ist – er stellt auch eine Governance-Herausforderung dar. 

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.