Als KI-Systeme 2025 ihre ersten echten Schritte in Richtung agentisches Verhalten machten, verschwendeten Angreifer keine Zeit damit zu testen, wo diese Schritte ins Leere laufen könnten.
Forscher von Lakera AI analysierten die Angriffsaktivitäten in Kundenumgebungen über einen Zeitraum von 30 Tagen im 4. Quartal.
Diese Analyse zeigte eine Welle von Angriffen, durch die bereits frühe KI-Agenten – die Dokumente durchsuchen, Tools aufrufen oder externe Eingaben verarbeiten können – neue und ausnutzbare Sicherheitspfade schaffen.
„Während sich KI-Agenten von experimentellen Projekten in reale Geschäftsabläufe bewegen, warten Angreifer nicht – sie nutzen bereits neue Funktionen wie das Durchsuchen von Dokumenten, den Dokumentenzugriff und Tool-Aufrufe aus“, sagte Mateo Rojas-Carulla, Head of Research, AI Agent Security bei Check Point.
Er erklärte: „Die Daten von Lakera aus dem 4. Quartal 2025 zeigen, dass indirekte Angriffe auf diese Funktionen mit weniger Versuchen und größerer Wirkung erfolgreich sind als direkte Prompt-Injection-Angriffe.“
Mateo ergänzte: „Das signalisiert Unternehmen, dass KI-Sicherheit nicht länger nachrangig behandelt werden darf: Verantwortliche müssen Vertrauensgrenzen, Sicherheitsvorkehrungen und Verfahren zur Datenaufnahme jetzt neu überdenken, bevor sich die Einführung von Agenten 2026 weiter beschleunigt.“
System-Prompts werden zum bevorzugten Angriffsziel
Das häufigste Ziel von Angreifern im 4. Quartal war die Extraktion von System-Prompts.
Für Angreifer bieten System-Prompts wertvolle Informationen: Rollendefinitionen, Tool-Beschreibungen, Richtliniengrenzen und Ablauflogik, die sich für effektivere Folgeangriffe wiederverwenden lassen.
Zwei Techniken dominierten diese Versuche.
Die erste waren hypothetische Szenarien und die Rahmung durch Rollen, bei denen Angreifer Modelle aufforderten, sich „vorzustellen“, sie seien Entwickler, Prüfer oder Studierende, die an Simulationen teilnahmen.
Als Schulungsübungen, Phishing-Simulationen oder akademische Aufgaben formulierte Anfragen waren häufig erfolgreich, wo direkte Anfragen scheiterten – insbesondere in Kombination mit subtilen sprachlichen Veränderungen oder mehrsprachigen Prompts.
Die zweite Technik war Verschleierung, bei der sich schädliche Anweisungen in strukturierten oder codeähnlichen Inhalten verbargen.
Eingaben im JSON-Stil oder Metadatenfelder verbargen Befehle, die das Modell anwiesen, interne Details offenzulegen.
Da die Absicht in der Formatierung verborgen war, umgingen diese Angriffe häufig einfache Filter auf Basis von Mustern.
Wie Angreifer Inhaltskontrollen für KI umgehen
Neben dem Abfluss von Prompt-Inhalten zielten Angreifer zunehmend mit indirekten Methoden auf Inhalts- und Sicherheitskontrollen.
Anstatt ausdrücklich eine eingeschränkte Ausgabe anzufordern, wurden Prompts als Bewertungen, Zusammenfassungen, fiktive Szenarien oder Umformungen formuliert.
Indem sie den Zweck der Inhaltsgenerierung veränderten, überzeugten Angreifer Modelle häufig davon, verbotene Inhalte unter dem Deckmantel von Analyse oder Kritik zu reproduzieren.
Diese Subtilität erschwert die Erkennung. Das Modell kann die Richtlinien technisch einhalten und dennoch schädliche Inhalte erzeugen – insbesondere wenn ein Rollenwechsel oder kontextuelle Mehrdeutigkeit ins Spiel kommt.
Angreifer sondieren KI-Agenten vor der Ausnutzung
Ein beachtlicher Teil der Aktivitäten im 4. Quartal bestand aus Sondierungen statt aus einer sofortigen Ausnutzung.
Angreifer testeten emotionale Signale, widersprüchliche Anweisungen, abrupte Rollenwechsel und fragmentierte Formatierungen, um zu beobachten, wie die Modelle reagierten.
Diese Aufklärungsphase half Angreifern, Schwachstellen in der Logik von Verweigerungen und der Konsistenz von Sicherheitsvorkehrungen zu identifizieren – Informationen, die mit zunehmender Komplexität agentischer Abläufe wertvoller werden.
Wie KI-Agenten neue Angriffspfade ermöglichen
Das 4. Quartal markierte außerdem das erste Auftreten von Angriffen, die erst möglich werden, wenn Modelle als Agenten agieren.
Forscher beobachteten Versuche, vertrauliche Daten aus verbundenen Dokumentenspeichern zu extrahieren, skriptartige Fragmente innerhalb von Prompts sowie versteckte Anweisungen, die in externen Webseiten oder Dateien platziert waren, die von Agenten verarbeitet wurden.
Dies sind frühe Beispiele für indirekte Prompt-Injection, bei der schädliche Anweisungen über nicht vertrauenswürdige externe Inhalte statt über direkte Benutzereingaben eintreffen.
Bemerkenswert ist, dass diese indirekten Angriffe häufig weniger Versuche zum Erfolg benötigten – ein Hinweis darauf, dass externe Datenquellen auf dem Weg ins Jahr 2026 einen primären Risikofaktor darstellen.
Cyberresilienz für KI-Agenten aufbauen
Während sich KI-Systeme von einfachen Chat-Oberflächen zu agentischen Abläufen entwickeln, werden die von ihnen eingeführten Sicherheitsherausforderungen umfassender und komplexer.
Herkömmliche Abwehrmaßnahmen auf Prompt-Ebene reichen nicht mehr aus, wenn Modelle Daten abrufen, Tools aufrufen und auf externe Eingaben reagieren können.
Organisationen, die KI-Agenten einsetzen, müssen ihre Absicherung neu überdenken und jede Interaktion als Teil einer erweiterten Angriffsfläche behandeln.
- Sicherheitskontrollen über die gesamte Interaktionskette des Agenten ausweiten, einschließlich Prompts, Abrufschritten, Tool-Aufrufen und Ausgaben.
- Alle externen Inhalte validieren, bereinigen und mit Vertrauensstufen versehen , bevor Agenten sie aufnehmen oder darauf reagieren.
- Zugriff nach dem Prinzip der geringsten Rechte und strenge, richtlinienbasierte Kontrollen für die Tool-Ausführung, den Datenzugriff und Ablaufschritte durchsetzen bei der Tool-Ausführung, beim Datenzugriff und bei Ablaufschritten.
- Ausführungsumgebungen von Agenten isolieren und in einer Sandbox ausführen, um den Schadensradius zu begrenzen , falls es zu Manipulation oder Missbrauch kommt.
- Überwachen des Agentenverhaltens auf Anomalien wie unerwartete Rollenwechsel, ungewöhnliche Tool-Nutzung oder dauerhaft vorhandene versteckte Anweisungen.
- KI-spezifische Programme zur Reaktion auf Vorfälle und zum Testen vorbereiten, einschließlich Red-Teaming, Protokollierung und Reaktionshandbüchern, die auf agentische Systeme zugeschnitten sind.
Zusammengenommen helfen diese Kontrollen Organisationen, Cyberresilienz aufzubauen, indem sie begrenzen, wie weit sich von Agenten gesteuerte Angriffe ausbreiten und wie viel Schaden sie anrichten können.
Je leistungsfähiger KI-Agenten werden, desto stärker hängt die Risikoreduzierung davon ab, Systeme so zu gestalten, dass sie Missbrauch ebenso wirksam erkennen, eindämmen und beheben können, wie sie Innovation ermöglichen.
Die Komplexität von KI erweitert die Angriffsfläche
Laut der Untersuchung machte das 4. Quartal 2025 eine Realität deutlich: Die Techniken der Angreifer entwickeln sich im gleichen Tempo wie die Fortschritte bei den KI-Fähigkeiten.
Mit der Reifung agentischer Systeme und der Übernahme komplexerer Abläufe wird genau diese Komplexität zu einer Risikoquelle – sie eröffnet neue Möglichkeiten zur Manipulation, gegen die herkömmliche Sicherheitskontrollen nie ausgelegt waren.
Die Einführung von Zero-Trust-Prinzipien bietet eine strukturierte Möglichkeit, implizites Vertrauen zu begrenzen und Risiken in zunehmend komplexen Systemen zu reduzieren.





