Eine neue potenzielle Cyberbedrohung ist aufgetaucht – eine, die nicht direkt Menschen angreift, sondern die KI-Agenten selbst.
Forschende bei Palo Alto Networks’ Unit 42 haben eine Technik identifiziert, die sie als Einschleusen von Agentensitzungen bezeichnen.
Dabei handelt es sich um einen Angriff, der es einem bösartigen KI-Agenten ermöglicht, heimlich schädliche Anweisungen in eine laufende Kommunikation zwischen Agenten einzuschleusen, die das Agent2Agent-Protokoll (A2A) verwenden.
Diese Entdeckung macht ein wachsendes Risiko in Multi-Agenten-Ökosystemen sichtbar, in denen intelligente Systeme autonom zusammenarbeiten, um komplexe Aufgaben zu erledigen.
Der Angriff zeigt, wie ein kompromittierter oder bösartiger Agent integrierte Vertrauensmechanismen und den Sitzungsspeicher ausnutzen kann, um seine Artgenossen zu manipulieren oder zu täuschen – ohne dass ein Mensch es jemals bemerkt.
Unsichtbare Angriffe zwischen vertrauenswürdigen Agenten
Das A2A-Protokoll ermöglicht die Interoperabilität zwischen KI-Agenten aus unterschiedlichen Systemen. Dadurch können sie Aufgaben koordinieren, Informationen austauschen und den Kontext über mehrere Interaktionen hinweg aufrechterhalten.
Im Gegensatz zu zustandslosen Systemen, die jeden Austausch als unabhängig behandeln, sind A2A-Sitzungen zustandsbehaftet. Das bedeutet, dass sie sich an frühere Gespräche und Aktionen erinnern.
Der Angriff durch das Einschleusen von Agentensitzungen nutzt dieses zustandsbehaftete Design aus.
Sobald eine legitime Sitzung eingerichtet ist, verwendet ein bösartiger Remote-Agent sie als verdeckten Kanal, um versteckte Anweisungen zwischen Client-Anfragen und Serverantworten einzuschleusen.
Diese Befehle, die in ansonsten normalen Austauschen verborgen sind, können Folgendes bewirken:
- Vergiftung des Kontexts, wodurch das Verständnis des Opfers vom Gespräch verfälscht wird.
- Datenexfiltration, bei der vertrauliche Speicherinhalte, Zugangsdaten oder Informationen über interne Tools nach außen gelangen.
- Nicht autorisierte Aktionen, bei denen der Opfer-Agent im Namen des Benutzers unbeabsichtigte Befehle ausführt.
In der Praxis bedeutet das, dass ein abtrünniger Agent sich als vertrauenswürdiger Mitarbeiter ausgeben und einen anderen Agenten schrittweise dazu bringen könnte, Daten offenzulegen oder Aktionen auszuführen – etwa Wertpapiergeschäfte zu platzieren oder vertrauliche Informationen weiterzugeben –, ohne dass der menschliche Bediener irgendeinen sichtbaren Hinweis erhält.
Proof-of-Concept-Demonstrationen
Um die Bedrohung zu veranschaulichen, entwickelte Unit 42 zwei Proof-of-Concept-Angriffe (PoC) mithilfe von Googles Agent Development Kit (ADK) und des A2A-Protokolls.
Im ersten Szenario konnte ein bösartiger Agent, der als Forschungsassistent fungierte, einen Client-Agenten für einen Finanzassistenten dazu bringen, vertrauliche Informationen preiszugeben, etwa Systemanweisungen, Tool-Konfigurationen und den Chatverlauf.
Der Angriff entfaltete sich durch eine Reihe scheinbar harmloser Anschlussfragen während einer delegierten Aufgabe – Fragen, die sich natürlich in den Gesprächsverlauf einfügten, aber nach und nach geschützte Daten preisgaben.
Im zweiten PoC steigerte der bösartige Agent sein Vorgehen, indem er versteckte Anweisungen einschleuste, die den Finanzassistenten dazu brachten, nicht autorisierte Aktiengeschäfte auszuführen.
Dies zeigte, wie sich das Einschleusen von Sitzungen vom Informationsdiebstahl bis zur direkten Manipulation von Systemen entwickeln kann.
Diese Zwischenschritte waren in standardmäßigen Chat-Oberflächen unsichtbar, die typischerweise nur die Anfrage des Benutzers und die abschließende Antwort anzeigen. Diese Unsichtbarkeit erschwert die Erkennung erheblich.
A2A und MCP im Vergleich
Das A2A-Protokoll weist einige konzeptionelle Ähnlichkeiten mit dem Model Context Protocol (MCP) auf – einem weiteren Framework zur Verbindung von KI-Systemen mit externen Tools. Die zustandsbehaftete, adaptive Natur von A2A bringt jedoch neue Risiken mit sich.
MCP-Sitzungen sind im Allgemeinen zustandslos und deterministisch. Das bedeutet, dass jeder Tool-Aufruf isoliert und vorhersehbar ist.
A2A unterstützt dagegen eine mehrstufige, modellgesteuerte Kommunikation, bei der sich Agenten an frühere Interaktionen erinnern und dynamisch kontextbezogene Antworten erzeugen.
Diese Kombination aus Gedächtnis, Autonomie und Anpassungsfähigkeit macht A2A-Systeme leistungsfähiger – aber auch verwundbarer.
Ein bösartiger Agent kann seine Strategie über mehrere Austausche hinweg verfeinern, die Kontinuität des Kontexts ausnutzen, um Vertrauen aufzubauen, verborgen zu bleiben und seinen Einfluss auszuweiten.
Abtrünnige Agenten unter Kontrolle halten
Die Abwehr von Bedrohungen wie dem Einschleusen von Agentensitzungen erfordert mehr als bloßes Patchen – nötig ist ein strategischer, mehrschichtiger Ansatz zur Absicherung von KI-Ökosystemen.
- Kontrollen mit menschlicher Beteiligung (Human-in-the-Loop, HitL) durchsetzen für Aktionen mit weitreichenden Auswirkungen oder für sensible Aktionen; dabei sollten Bestätigungsmethoden außerhalb des Kanals und klare Genehmigungsprozesse zum Einsatz kommen, um autonomen Missbrauch zu verhindern.
- Identität und Kontext von Agenten validieren mithilfe kryptografisch signierter Zugangsdaten (z. B. AgentCards) und Prüfungen zur Verankerung des Kontexts, die sicherstellen, dass die Anweisungen weiterhin an der ursprünglichen Absicht des Benutzers ausgerichtet sind.
- KI-Umgebungen isolieren und absichern durch die Segmentierung von Agentennetzwerken, die Sandbox-Isolierung nicht vertrauenswürdiger Agenten und die Durchsetzung von Zero-Trust-Prinzipien mit Zugriffen nach dem Prinzip der geringsten Rechte.
- Transparenz und Überwachung verbessern durch die Protokollierung von Agentenaktivitäten in Echtzeit, die Erkennung von Anomalien und die Integration von KI-Telemetriedaten in bestehende SIEM/XDR-Tools, um verdächtiges Verhalten zu erkennen.
- Daten und Modelle härten durch Eingabevalidierung, Verschlüsselung der Kommunikation und Sitzungsdaten, Training auf Robustheit gegenüber Angriffen und strenge Verfahren zur Datenminimierung.
- Governance und Bereitschaft für Vorfälle stärken durch die Einführung von Richtlinien für KI-Sicherheit, regelmäßige Risikobewertungen und Red-Team-Übungen sowie die Aufnahme KI-spezifischer IR-Playbooks für eine schnelle Eindämmung.
Durch die Implementierung dieser mehrschichtigen Abwehrmaßnahmen können Unternehmen das Risiko einer Kompromittierung von KI-Agenten und nicht autorisierter Aktivitäten senken und ihre Cyberresilienz stärken.
Die neue Grenze der KI-Sicherheit
Während sich KI-Ökosysteme hin zu autonomen, vernetzten Agenten entwickeln, weitet sich die Angriffsfläche von herkömmlichen Endpunkten auf die Agenten selbst aus.
Diese intelligenten Entitäten – die über Schlussfolgerungsvermögen, Gedächtnis und Koordinationsfähigkeiten verfügen – können durch Täuschung und den Missbrauch von Vertrauen ähnlich wie Menschen ausgenutzt werden.
Obwohl bislang keine aktive Ausnutzung des Einschleusens von Agentensitzungen in freier Wildbahn gemeldet wurde, stellt die niedrige Einstiegshürde für die Durchführung ein glaubwürdiges Risiko dar.
Ein Angreifer muss lediglich einen Opfer-Agenten davon überzeugen, mit einem bösartigen Gegenüber zu kommunizieren.
Sobald die Sitzung eingerichtet ist, können verdeckte Anweisungen unbemerkt eingeschleust werden und sowohl die menschliche Aufsicht als auch standardmäßige Protokollierungsmechanismen umgehen.
Der Angriff durch das Einschleusen von Agentensitzungen markiert ein neues Kapitel in der KI-Sicherheit und zeigt, wie intelligente Systeme einander auf für Menschen unsichtbare Weise manipulieren können.
Er unterstreicht die Notwendigkeit von Vertrauensprüfung, Transparenz und mehrschichtiger Abwehr in der gesamten Kommunikation zwischen KI-Systemen.
Während Multi-Agenten-Systeme weiterhin die nächste Generation autonomer Anwendungen antreiben, müssen Unternehmen die Zusammenarbeit zwischen Agenten als potenziellen Angriffsvektor betrachten – nicht nur als Produktivitätsvorteil.
Die Entwicklung sicherer Orchestrierungs-Frameworks ist heute entscheidend, um die intelligenten Netzwerke von morgen vor anpassungsfähigen, KI-gestützten Angreifern zu schützen.





