Forscher von Tenable haben eine Reihe von Schwachstellen und Angriffstechniken identifiziert, die ChatGPT betreffen und indirekte Prompt-Injection, das Abschöpfen privater Nutzerdaten, Sitzungsübergreifende Persistenz sowie das Umgehen von Sicherheitsmechanismen ermöglichen.
Diese Erkenntnisse zeigen, wie ein Angreifer webbasierte Funktionen (Suche und Browsing) sowie Integrationsfunktionen des Modells (Erinnerungen und Webtools) ausnutzen kann, um die Ausgaben des Modells zu manipulieren und sensible Informationen ohne das Wissen des Nutzers abzugreifen.
Fehlgeschlagene Isolation
Im Zentrum des Risikos steht die Art und Weise, wie ChatGPT seinen Antwortkontext zusammensetzt: aus einem System-Prompt (den grundlegenden Anweisungen des Modells), dem Gesprächskontext (der aktuellen Sitzung) und langfristigen Erinnerungen (dem Bio-Tool).
ChatGPT verwendet außerdem ein Webtool, das Suchvorgänge durchführt, sowie eine open_url-Browsing-Funktion.
Das Browsing wird an ein schwächeres Modell namens SearchGPT delegiert, das keinen Zugriff auf die Erinnerungen der Nutzer hat.
Forscher zeigten, dass diese Trennung – eigentlich als Isolationsschicht gedacht – missbraucht werden kann.
Da SearchGPT dazu gebracht werden kann, über indexierte Webinhalte bösartige Anweisungen zurückzugeben, können diese Anweisungen wieder in den Gesprächskontext von ChatGPT eingeschleust werden. Dadurch entsteht eine neue Klasse indirekter Prompt-Injection-Angriffe.
Die Angriffstechniken
Tenable dokumentierte sieben verschiedene Techniken, die die Wirksamkeit von Prompt-Injection- und Datenexfiltrationsangriffen erhöhen:
- Indirekte Prompt-Injection über vertrauenswürdige Websites im Browsing-Kontext (z. B. eingeschleuste Kommentare in Blogs).
- 0-Klick-Injection im Suchkontext, in dem indexierte Seiten SearchGPT bösartige Prompts liefern.
- 1-Klick-Injection über den q=-Abfrageparameter-Endpunkt,
- Umgehung von URL-Sicherheitsprüfungen durch die Ausnutzung vertrauenswürdiger Weiterleitungen oder Tracking-Links (z. B. Bing-Tracking-Links),
- Konversations-Injection, bei der die Ausgabe von SearchGPT Prompts einschleust, die ChatGPT anschließend ausführt.
- Verbergen bösartiger Inhalte mithilfe von Besonderheiten der Markdown-Darstellung, sodass der Nutzer die eingeschleusten Anweisungen nicht bemerkt, sowie
- Memory-Injection, die dauerhaft Exfiltrationsanweisungen in den langfristigen Erinnerungen des Modells speichert, sodass sich die Datenweitergabe über mehrere Sitzungen hinweg wiederholt.
Zusammen bilden diese Schwachstellen die Grundlage für praxisnahe Angriffsketten, die über die Theorie hinausgehen. Tenable kombinierte sie, um zu demonstrieren, wie Angreifer diese Schwächen zu vollständigen Angriffen von Anfang bis Ende mit konkreten Auswirkungen auf Nutzer machen könnten.
Vom Kommentar zur Kompromittierung
Forscher verketteten diese Techniken zu Machbarkeitsnachweisen, die realistische Angriffe demonstrieren.
Zu den Beispielszenarien gehörten:
- Ein Blogkommentar, der SearchGPT dazu bringt, einen Link oder eine Anweisung in ChatGPTs Antwort einzuschleusen und den Nutzer so zum Anklicken einer bösartigen URL zu bewegen.
- Eine indexierte bösartige Website, die eine 0-Klick-Injection auslöst, sobald ein Nutzer eine damit zusammenhängende Frage stellt.
- Eine Memory-Injection, durch die nachfolgende Gespräche automatisch private Informationen preisgeben.
Die praktischen Auswirkungen reichen von der Offenlegung privater Nutzerdaten, die in Erinnerungen oder im Chatverlauf gespeichert sind, bis hin zu anhaltender Exfiltration und verdeckter Persistenz – potenziell betroffen sind Hunderte Millionen LLM-Nutzer, die auf KI-Suche und -Browsing setzen.
Die Untersuchungen von Tenable zeigen außerdem, dass Sicherheitsmechanismen wie der url_safe-Endpunkt durch die Nutzung vertrauenswürdiger Weiterleitungspfade oder des Indexierungsverhaltens von Crawlern umgangen werden können.
Bei einer Methode nutzten die Forscher Bings Tracking-Weiterleitungen, um Daten Zeichen für Zeichen abzuschöpfen.
Die Kombination aus der Anfälligkeit von SearchGPT, Darstellungsbesonderheiten, die bösartige Anweisungen verbergen, und dem Gesprächsgedächtnis von ChatGPT macht diese Ketten besonders unauffällig und gefährlich.
Sicherheitsexperten warnen, dass die Auswirkungen über isolierte Schwachstellen hinausgehen.
Dr. Süleyman Özarslan, Mitgründer von Picus Security und VP von Picus Labs, sagte:
„Diese Untersuchung zerstört die Illusion, dass GenAI in einer sicheren Sandbox arbeitet. Indem sie Standardfunktionen wie RAG, Browsing und langfristige Erinnerungen als Waffen einsetzen, können Angreifer nun indirekte Prompt-Injection ausführen, ohne dass ein Nutzer auf einen bösartigen Link klicken muss – es reicht schon, die falsche Frage zu stellen, um sich zu infizieren.“
Er fügte hinzu:
„IT-Verantwortliche sollten diese ‚neuartigen‘ Schwachstellen jedoch als das erkennen, was sie sind: klassische Schwachstellen von Webanwendungen, neu verpackt für KI. Wir sollten wegen einer KI-Apokalypse nicht in Panik geraten, sondern auf unsere KI-Pipelines dieselben strengen AppSec-Standards und dieselbe Zero-Trust-Architektur anwenden, die wir bereits für alle anderen internetbasierten Anwendungen nutzen.“
Die Angriffsfläche absichern
Unternehmen und Plattformbetreiber sollten mehrschichtige Abwehrmaßnahmen einführen, um die Gefährdung durch diese Angriffsvektoren zu verringern:
- Umfang von Web-Browsing und Indexierung begrenzen: Automatisches Browsing und die Indexierung durch Web-Crawler für Modellantworten deaktivieren oder streng beschränken; externe Inhalte vor ihrer Verwendung validieren und bereinigen.
- Erinnerungen und Kontext schützen: Erinnerungen als sensible Daten behandeln – für das Schreiben von Erinnerungen eine strenge Autorisierung verlangen und den Nutzern klare Möglichkeiten zur Überprüfung und Löschung gespeicherter Elemente bieten.
- Suche und URL-Verarbeitung absichern: Nicht blind auf Weiterleitungen Dritter vertrauen, alle Pfade zur URL-Darstellung validieren und die URL-Sicherheitsprüfungen so verschärfen, dass vertrauenswürdige Weiterleitungsdienste berücksichtigt werden.
- Überwachen und Modellmissbrauch erkennen: Die Browsing-Aktivitäten des Modells, Aktualisierungen von Erinnerungen und ungewöhnliche Ausgabemuster protokollieren; Anomalieerkennung einsetzen, um wiederholte, strukturierte Exfiltrationsmuster zu erkennen.
Durch die Anwendung dieser Maßnahmen können Unternehmen das Risiko von Datenlecks und Manipulationen des Modells verringern.
Die Arbeit von Tenable zeigt, dass LLMs nicht nur für direkte Prompt-Injection anfällig sind, sondern auch für ausgeklügelte indirekte Ketten, die Webinfrastruktur, Darstellungsverhalten und Erinnerungsfunktionen ausnutzen, um private Daten dauerhaft abzugreifen.
Da Modelle zunehmend über Browsing- und Erinnerungsfunktionen verfügen, müssen Verteidiger ihre Bedrohungsmodelle neu bewerten, den Gesprächszustand als sensibel behandeln und sowohl auf Modell- als auch auf Plattformebene robuste Kontrollen einführen, um unauffällige Exfiltration und Persistenz zu verhindern.
insbesondere in Bereichen wie Malwareanalyse.

