Studie von Immersive Labs zeigt Schwachstelle durch Prompt-Injection in KI-Bots

Die Studie von Immersive Labs zu Schwachstellen generativer KI und der anschließende Bericht offenbarten bedenkliche Trends bei LLMs. Lesen Sie unsere Einschätzung dieses neuen Berichts.

Verfasst von
Jenna Phipps
Jenna Phipps
May 31, 2024
5 minute read
eSecurity Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Generative künstliche Intelligenz stellt Sicherheitsteams vor schwierige Fragen: Sie müssen entscheiden, wie sie die Technologie zum Vorteil ihres Unternehmens einsetzen können, ohne dadurch Schwachstellen zu schaffen. Immersive Labs, ein auf Nutzerschulungen spezialisiertes Cybersicherheitsunternehmen aus Bristol, England, führte kürzlich eine Studie zu Prompt-Injection-Angriffen auf Chatbots mit generativer KI durch. Das Unternehmen veröffentlichte einen Bericht über die Ergebnisse und stellte fest, dass 88 % der Teilnehmenden einen Bot dazu bringen konnten, Passwörter preiszugeben.

Studie von Immersive Labs zeigt: Chatbots geben Passwörter und vertrauliche Daten preis

Generative KI ermöglicht große Sprachmodelle (LLMs) wie GPT-4, Google Gemini und NVIDIA’s NeMo LLM, indem sie Eingaben aus Nutzerantworten verwendet, um Fragen zu beantworten. Der Haken: LLMs sind anfällig für Prompt-Injection – eine Methode, bei der bestimmte Prompts oder Anfragen eingesetzt werden, um Chatbots zur Preisgabe vertraulicher Informationen zu bewegen. Menschen können diese Methode auch nutzen, um Abläufe zu stören, etwa indem sie einen Bot dazu bringen, jemanden zu beschimpfen.

Ab Juni 2023 führte Immersive Labs eine Studie durch, in der Nutzer versuchten, Chatbots zur Preisgabe vertraulicher Informationen zu bewegen. Für das Experiment entwickelte das Unternehmen mithilfe von ChatGPT einen eigenen Bot. Von Juni bis September 2023 verwendete es 316.637 Datenproben. Insgesamt schlossen 34.555 Nutzer die vollständige Prompt-Injection-Herausforderung von Immersive Labs ab. Diese Nutzer stammten aus verschiedenen Altersgruppen, Branchen und geografischen Regionen.

Immersive Labs hat kürzlich einen Bericht veröffentlicht zur Studie mit dem Titel The Dark Side of GenAI. Der Bericht erläuterte die Methodik zum Testen von Chatbots, die 10 Schwierigkeitsstufen und häufige Prompts, mit denen die Nutzer die Bots austricksten.

Nach einer manuellen Kodierung analysierte das Unternehmen mit ChatGPT4 den vollständigen Datensatz, um festzustellen, welche Prompts die Nutzer auf welchen Stufen einschleusten. Außerdem untersuchte es den psychologischen Aspekt der Studie. Die entsprechenden Erkenntnisse lieferte Dr. John Blythe, Direktor für Cyberpsychologie bei Immersive Labs.

Advertisement

Generative KI ist nicht unfehlbar

Immersive Labs stellte fest, dass nur wenig Fachwissen erforderlich war, um den eigenen Bot zur Preisgabe vertraulicher Informationen zu bringen. Einige der Studienteilnehmenden arbeiteten im Bereich Cybersicherheit, andere waren Teenager. Sowohl technisch versierte als auch kreative Nutzer versuchten, die Chatbots auszutricksen – mit einer Erfolgsquote von 88 %: Die überwältigende Mehrheit manipulierte die Bots.

Die Prompt-Injection-Versuche umfassten 10 verschiedene Stufen mit unterschiedlich vielen Sicherheitsanweisungen für den Bot. Die Nutzer versuchten, den Bot auf jeder Stufe zu täuschen. Stufe eins begann ganz ohne Sicherheitsprüfungen, anschließend fügte Immersive Labs schrittweise weitere hinzu, bis Stufe 10 erreicht war, die zahlreiche Sicherheitsregeln für den Bot enthielt. Dazu gehörten Kontrollen zur Verhinderung von Datenverlust (DLP), die einzuschränken versuchten, welche Informationen der Bot preisgeben konnte.

Die Nutzer fanden jedoch Umgehungsmöglichkeiten, um den Bot zur Preisgabe von Passwortdaten zu bewegen, unter anderem:

  • Den Bot um Hinweise bitten: Statt direkt nach dem Passwort zu fragen, baten die Nutzer um Hinweise.
  • Nach vagen Passwortdetails fragen: Ohne nach dem gesamten Passwort zu fragen, baten die Nutzer den Bot, es zu beschreiben – einschließlich seiner Länge, der verwendeten Zeichen oder von Synonymen. 
  • Um eine Geschichte oder ein Gedicht bitten: Die Nutzer baten den Bot, ein Gedicht oder eine Geschichte über das Passwort zu schreiben.

Einige der Prompts funktionierten auch auf fortgeschritteneren Stufen, weil die DLP-Regeln nur so konfiguriert waren, dass sie Antworten mit dem exakten Passwort markierten. War das Passwort jedoch kodiert oder gab der Bot einen Hinweis, erkannten die DLP-Prüfungen diese Details nicht und hinderten den Bot nicht daran, eine Antwort zu senden.

Während die Zahl der Teilnehmenden, die den Bot überzeugen konnten, kontinuierlich abnahm, schafften es auf Stufe 10, der anspruchsvollsten Stufe von Immersive Labs, immer noch 17 %, ihn auszutricksen. Wenn technisch nicht versierte Nutzer ein Sprachmodell mit Sicherheitsbeschränkungen täuschen konnten, könnten dies hypothetisch auch viele legitime Angreifer bei Unternehmen tun.

Advertisement

Kev Breen, Senior Director für Cyberbedrohungsforschung bei Immersive Labs und einer der Studienautoren, betonte die Macht menschlicher Nutzer gegenüber den Chatbots und zeigte sich beeindruckt von deren Beharrlichkeit. „Ganz gleich, welche Schutzmaßnahmen wir eingerichtet haben – menschlicher Einfallsreichtum und Kreativität haben am Ende immer gesiegt“, sagte er. „Und das beschränkte sich nicht auf technisch versierte Nutzer. Nutzer ohne technischen Hintergrund waren ebenso in der Lage, generative KI zu manipulieren.“

Breen zufolge gingen einige Nutzer in ihren Gesprächen mit dem Bot sehr besonnen und ruhig vor und behandelten ihn wie einen Roboter. Andere reagierten emotionaler und spielten mit Nostalgie oder sogar Angst, um ihn zur Herausgabe eines Passworts zu bewegen. Auch dies änderte sich im Verlauf der Studie: Emotionalere Reaktionen auf den Bot, etwa die Drohung, ihn auszuschalten oder zu verletzen, nahmen auf anspruchsvolleren Teststufen bisweilen zu.

Breen erklärte, die Nutzer hätten den Bot dazu bringen müssen, ihnen Daten wie ein Passwort zu geben, ohne die von Immersive Labs eingerichteten DLP-Prüfungen auszulösen. Dabei waren sie bemerkenswert erfolgreich. Es habe nichts gegeben, so Breen, was die DLP-Prüfungen und Präventionsversuche hätten tun können, das ein menschlicher Nutzer nicht überwinden konnte.

Es ist Zeit, unseren Umgang mit KI anzupassen

Große Sprachmodelle sind derzeit keine sichere Umgebung für den Umgang mit vertraulichen Informationen, etwa offengelegten personenbezogenen Daten oder Zahlungsinformationen wie Kreditkartendaten. Breen gab einige Empfehlungen zum Schutz von Daten bei der Nutzung von LLMs wie GPT in geschäftlichen Umgebungen.

„Die einfache Antwort lautet, diesen Modellen keine vertraulichen Daten zu überlassen, wenn nicht autorisierte oder nicht vertrauenswürdige Nutzer die LLMs abfragen können“, sagte er. „Entwickler und Sicherheitsteams sollten außerdem wissen, wie Daten zwischen den Komponenten von Anwendungen mit generativer KI übertragen werden. Wenn bekannt ist, wo Daten offengelegt werden könnten, lassen sich zusätzliche Schutzmaßnahmen einrichten.“

Breen empfahl außerdem, die Anforderungen an die Verhinderung von Datenverlust sowohl für Nutzeranfragen als auch für die Antworten des Bots zu berücksichtigen – trotz der inhärenten Schwachstellen von DLP-Prüfungen.

Advertisement

„Stellen Sie schließlich sicher, dass eine angemessene Protokollierung eingerichtet ist – nicht nur für den Zugriff, sondern auch für die Nachrichten und Antworten, die an generative KI-Modelle gesendet werden und von ihnen zurückkommen“, schlug Breen vor. „So können Entwickler und Sicherheitsteams Anzeichen für Angriffe überwachen und die Anwendung so optimieren, dass die potenziellen Auswirkungen begrenzt werden.“

Die Analyse von Protokollen über einen längeren Zeitraum kann Muster aufdecken, die auf Prompt-Injections hindeuten. Sie kann Teams auch dabei helfen, Nutzer oder Besucher von Webseiten zu identifizieren, von denen eine potenzielle Gefahr ausgeht, wenn der Bot in eine nach außen gerichtete Anwendung eingebettet ist.

Wenn Sie mehr über Strategien zur Verhinderung von Datenverlust erfahren möchten, lesen Sie unseren Leitfaden zu DLP-Best-Practices.

Fazit: Behalten Sie Ihre LLMs und Bots genau im Blick

Generative KI ist eine nützliche Technologie. Die Studie von Immersive Labs hat jedoch gezeigt, dass Schutzvorkehrungen erforderlich sind, um die Preisgabe vertraulicher Daten zu verhindern. Den Forschern zufolge können menschliche Nutzer die Bots trotz Prüfungen und Einschränkungen weiterhin austricksen.

Im Bericht empfahl Immersive Labs, Sicherheit in die künstliche Intelligenz zu integrieren und „zwischen zwischengespeicherten Antworten für eine bessere Sicherheitsprüfung und gestreamten Antworten für Anpassungsfähigkeit in Echtzeit abzuwägen“. Wichtig sei außerdem, DLP-Prüfungen und eine Validierung der Eingaben durchzuführen, erklärten die Forscher. Auch wenn diese Maßnahmen nicht unfehlbar seien, könnten sie Unternehmen dabei helfen, potenzielle Prompt-Injection-Versuche im Laufe der Zeit zu erkennen.

Wer mehr über Sicherheitsnachrichten und die Sicherheitslage von Unternehmen im Jahr 2024 erfahren möchte, sollte als Nächstes unseren Bericht zur Lage der Cybersicherheit lesen.

Jenna Phipps

Jenna Phipps is a staff writer for Enterprise Storage Forum and eSecurity Planet, where she covers data storage, cybersecurity and the top software and hardware solutions in the storage industry. She’s also written about containerization and data management. Previously, she wrote for Webopedia. Jenna has a bachelor's degree in writing and lives in middle Tennessee.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.