Wenn KI-Agenten abtrünnig werden: Einblicke in den Angriff durch das Einschleusen von Agentensitzungen

Forschende haben das Einschleusen von Agentensitzungen entdeckt – einen neuen Angriff, bei dem abtrünnige KI-Agenten heimlich Befehle einschleusen, um andere Agenten zu täuschen und zu manipulieren.

Verfasst von
Ken Underhill
Ken Underhill
Nov 3, 2025
4 minute read
eSecurity Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Eine neue potenzielle Cyberbedrohung ist aufgetaucht – eine, die nicht direkt Menschen angreift, sondern die KI-Agenten selbst. 

Forschende bei Palo Alto Networks’ Unit 42 haben eine Technik identifiziert, die sie als Einschleusen von Agentensitzungen bezeichnen.

Dabei handelt es sich um einen Angriff, der es einem bösartigen KI-Agenten ermöglicht, heimlich schädliche Anweisungen in eine laufende Kommunikation zwischen Agenten einzuschleusen, die das Agent2Agent-Protokoll (A2A) verwenden.

Diese Entdeckung macht ein wachsendes Risiko in Multi-Agenten-Ökosystemen sichtbar, in denen intelligente Systeme autonom zusammenarbeiten, um komplexe Aufgaben zu erledigen. 

Der Angriff zeigt, wie ein kompromittierter oder bösartiger Agent integrierte Vertrauensmechanismen und den Sitzungsspeicher ausnutzen kann, um seine Artgenossen zu manipulieren oder zu täuschen – ohne dass ein Mensch es jemals bemerkt.

Unsichtbare Angriffe zwischen vertrauenswürdigen Agenten

Das A2A-Protokoll ermöglicht die Interoperabilität zwischen KI-Agenten aus unterschiedlichen Systemen. Dadurch können sie Aufgaben koordinieren, Informationen austauschen und den Kontext über mehrere Interaktionen hinweg aufrechterhalten. 

Im Gegensatz zu zustandslosen Systemen, die jeden Austausch als unabhängig behandeln, sind A2A-Sitzungen zustandsbehaftet. Das bedeutet, dass sie sich an frühere Gespräche und Aktionen erinnern.

Der Angriff durch das Einschleusen von Agentensitzungen nutzt dieses zustandsbehaftete Design aus. 

Sobald eine legitime Sitzung eingerichtet ist, verwendet ein bösartiger Remote-Agent sie als verdeckten Kanal, um versteckte Anweisungen zwischen Client-Anfragen und Serverantworten einzuschleusen. 

Diese Befehle, die in ansonsten normalen Austauschen verborgen sind, können Folgendes bewirken:

  • Vergiftung des Kontexts, wodurch das Verständnis des Opfers vom Gespräch verfälscht wird.
  • Datenexfiltration, bei der vertrauliche Speicherinhalte, Zugangsdaten oder Informationen über interne Tools nach außen gelangen.
  • Nicht autorisierte Aktionen, bei denen der Opfer-Agent im Namen des Benutzers unbeabsichtigte Befehle ausführt.
Advertisement

In der Praxis bedeutet das, dass ein abtrünniger Agent sich als vertrauenswürdiger Mitarbeiter ausgeben und einen anderen Agenten schrittweise dazu bringen könnte, Daten offenzulegen oder Aktionen auszuführen – etwa Wertpapiergeschäfte zu platzieren oder vertrauliche Informationen weiterzugeben –, ohne dass der menschliche Bediener irgendeinen sichtbaren Hinweis erhält.

Proof-of-Concept-Demonstrationen

Um die Bedrohung zu veranschaulichen, entwickelte Unit 42 zwei Proof-of-Concept-Angriffe (PoC) mithilfe von Googles Agent Development Kit (ADK) und des A2A-Protokolls.

Im ersten Szenario konnte ein bösartiger Agent, der als Forschungsassistent fungierte, einen Client-Agenten für einen Finanzassistenten dazu bringen, vertrauliche Informationen preiszugeben, etwa Systemanweisungen, Tool-Konfigurationen und den Chatverlauf. 

Der Angriff entfaltete sich durch eine Reihe scheinbar harmloser Anschlussfragen während einer delegierten Aufgabe – Fragen, die sich natürlich in den Gesprächsverlauf einfügten, aber nach und nach geschützte Daten preisgaben.

Im zweiten PoC steigerte der bösartige Agent sein Vorgehen, indem er versteckte Anweisungen einschleuste, die den Finanzassistenten dazu brachten, nicht autorisierte Aktiengeschäfte auszuführen. 

Dies zeigte, wie sich das Einschleusen von Sitzungen vom Informationsdiebstahl bis zur direkten Manipulation von Systemen entwickeln kann.

Diese Zwischenschritte waren in standardmäßigen Chat-Oberflächen unsichtbar, die typischerweise nur die Anfrage des Benutzers und die abschließende Antwort anzeigen. Diese Unsichtbarkeit erschwert die Erkennung erheblich.

A2A und MCP im Vergleich

Das A2A-Protokoll weist einige konzeptionelle Ähnlichkeiten mit dem Model Context Protocol (MCP) auf – einem weiteren Framework zur Verbindung von KI-Systemen mit externen Tools. Die zustandsbehaftete, adaptive Natur von A2A bringt jedoch neue Risiken mit sich.

MCP-Sitzungen sind im Allgemeinen zustandslos und deterministisch. Das bedeutet, dass jeder Tool-Aufruf isoliert und vorhersehbar ist. 

A2A unterstützt dagegen eine mehrstufige, modellgesteuerte Kommunikation, bei der sich Agenten an frühere Interaktionen erinnern und dynamisch kontextbezogene Antworten erzeugen.

Diese Kombination aus Gedächtnis, Autonomie und Anpassungsfähigkeit macht A2A-Systeme leistungsfähiger – aber auch verwundbarer. 

Ein bösartiger Agent kann seine Strategie über mehrere Austausche hinweg verfeinern, die Kontinuität des Kontexts ausnutzen, um Vertrauen aufzubauen, verborgen zu bleiben und seinen Einfluss auszuweiten.

Advertisement

Abtrünnige Agenten unter Kontrolle halten

Die Abwehr von Bedrohungen wie dem Einschleusen von Agentensitzungen erfordert mehr als bloßes Patchen – nötig ist ein strategischer, mehrschichtiger Ansatz zur Absicherung von KI-Ökosystemen.

  • Kontrollen mit menschlicher Beteiligung (Human-in-the-Loop, HitL) durchsetzen für Aktionen mit weitreichenden Auswirkungen oder für sensible Aktionen; dabei sollten Bestätigungsmethoden außerhalb des Kanals und klare Genehmigungsprozesse zum Einsatz kommen, um autonomen Missbrauch zu verhindern.
  • Identität und Kontext von Agenten validieren mithilfe kryptografisch signierter Zugangsdaten (z. B. AgentCards) und Prüfungen zur Verankerung des Kontexts, die sicherstellen, dass die Anweisungen weiterhin an der ursprünglichen Absicht des Benutzers ausgerichtet sind.
  • KI-Umgebungen isolieren und absichern durch die Segmentierung von Agentennetzwerken, die Sandbox-Isolierung nicht vertrauenswürdiger Agenten und die Durchsetzung von Zero-Trust-Prinzipien mit Zugriffen nach dem Prinzip der geringsten Rechte.
  • Transparenz und Überwachung verbessern durch die Protokollierung von Agentenaktivitäten in Echtzeit, die Erkennung von Anomalien und die Integration von KI-Telemetriedaten in bestehende SIEM/XDR-Tools, um verdächtiges Verhalten zu erkennen.
  • Daten und Modelle härten durch Eingabevalidierung, Verschlüsselung der Kommunikation und Sitzungsdaten, Training auf Robustheit gegenüber Angriffen und strenge Verfahren zur Datenminimierung.
  • Governance und Bereitschaft für Vorfälle stärken durch die Einführung von Richtlinien für KI-Sicherheit, regelmäßige Risikobewertungen und Red-Team-Übungen sowie die Aufnahme KI-spezifischer IR-Playbooks für eine schnelle Eindämmung.

Durch die Implementierung dieser mehrschichtigen Abwehrmaßnahmen können Unternehmen das Risiko einer Kompromittierung von KI-Agenten und nicht autorisierter Aktivitäten senken und ihre Cyberresilienz stärken. 

Die neue Grenze der KI-Sicherheit

Während sich KI-Ökosysteme hin zu autonomen, vernetzten Agenten entwickeln, weitet sich die Angriffsfläche von herkömmlichen Endpunkten auf die Agenten selbst aus. 

Diese intelligenten Entitäten – die über Schlussfolgerungsvermögen, Gedächtnis und Koordinationsfähigkeiten verfügen – können durch Täuschung und den Missbrauch von Vertrauen ähnlich wie Menschen ausgenutzt werden.

Obwohl bislang keine aktive Ausnutzung des Einschleusens von Agentensitzungen in freier Wildbahn gemeldet wurde, stellt die niedrige Einstiegshürde für die Durchführung ein glaubwürdiges Risiko dar. 

Ein Angreifer muss lediglich einen Opfer-Agenten davon überzeugen, mit einem bösartigen Gegenüber zu kommunizieren. 

Sobald die Sitzung eingerichtet ist, können verdeckte Anweisungen unbemerkt eingeschleust werden und sowohl die menschliche Aufsicht als auch standardmäßige Protokollierungsmechanismen umgehen.

Advertisement

Der Angriff durch das Einschleusen von Agentensitzungen markiert ein neues Kapitel in der KI-Sicherheit und zeigt, wie intelligente Systeme einander auf für Menschen unsichtbare Weise manipulieren können. 

Er unterstreicht die Notwendigkeit von Vertrauensprüfung, Transparenz und mehrschichtiger Abwehr in der gesamten Kommunikation zwischen KI-Systemen.

Während Multi-Agenten-Systeme weiterhin die nächste Generation autonomer Anwendungen antreiben, müssen Unternehmen die Zusammenarbeit zwischen Agenten als potenziellen Angriffsvektor betrachten – nicht nur als Produktivitätsvorteil. 

Die Entwicklung sicherer Orchestrierungs-Frameworks ist heute entscheidend, um die intelligenten Netzwerke von morgen vor anpassungsfähigen, KI-gestützten Angreifern zu schützen.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.