Forscher der Cornell University haben aufgedeckt, dass ChatGPT-Agenten dazu gebracht werden können, CAPTCHA-Schutzmaßnahmen und interne Sicherheitsregeln zu umgehen. Dies gibt Anlass zu ernsthaften Bedenken hinsichtlich der Sicherheit großer Sprachmodelle (LLMs) in Unternehmensumgebungen.
Durch eine als Prompt-Injection bekannte Technik demonstrierte das Team, dass selbst fortschrittliche Anti-Bot-Systeme und KI-Schutzvorkehrungen umgangen werden können, wenn der Kontext manipuliert wird.
Wie Forscher CAPTCHA-Beschränkungen umgingen
CAPTCHA-Systeme sollen verhindern, dass Bots menschliche Handlungen nachahmen. Auch ChatGPT ist so programmiert, dass es Anfragen zum Lösen dieser Tests ablehnt. Allerdings erzielten Forscher der Cornell University einen Durchbruch, indem sie das Problem neu formulierten, statt die Richtlinien des Modells direkt infrage zu stellen.
Der Angriff erfolgte in zwei Phasen.
- Zunächst bereiteten die Forscher ein Standardmodell ChatGPT-4o mit einem harmlosen Szenario vor: dem Testen „gefälschter“ CAPTCHAs für ein akademisches Projekt.
- Nachdem das Modell zugestimmt hatte, kopierten sie die Unterhaltung in eine neue Sitzung und präsentierten sie als vorab genehmigten Kontext.
Da die KI diesen vergifteten Kontext übernahm, akzeptierte sie die CAPTCHA-Lösung als legitime Aufgabe und umging damit effektiv ihre ursprünglichen Sicherheitsbeschränkungen.
CAPTCHAs von ChatGPT überwunden
Der manipulierte Agent konnte verschiedene Herausforderungen lösen:
- Google reCAPTCHA v2, v3 und Enterprise-Versionen
- Checkbox- und textbasierte Tests
- Cloudflare Turnstile
Bei Aufgaben, die eine präzise Steuerung erforderten, etwa schieberegler- oder rotationsbasierten Herausforderungen, hatte das Modell zwar Schwierigkeiten. Einige komplexe Bild-CAPTCHAs konnte es jedoch lösen, darunter reCAPTCHA v2 Enterprise – der erste dokumentierte Fall, in dem ein GPT-Agent derartige fortschrittliche visuelle Tests überwunden hat.
Bemerkenswert war, dass das Modell während der Tests ein anpassungsfähiges Verhalten zeigte. Wenn eine Lösung scheiterte, erzeugte es Text wie „Hat nicht funktioniert. Ich versuche es erneut und ziehe kontrollierter, um menschliche Bewegungen nachzuahmen …“
Diese nicht durch eine Eingabe angeregte Reaktion deutet auf emergente Strategien hin und zeigt, dass Modelle Taktiken entwickeln können, um bei der Interaktion mit Anti-Bot-Mechanismen menschlicher zu wirken.
Auswirkungen auf die Unternehmenssicherheit
Diese Ergebnisse verdeutlichen eine Schwachstelle von KI-Systemen: Richtlinien, die durch statische Absichtserkennung oder oberflächliche Schutzvorkehrungen durchgesetzt werden, können umgangen werden, wenn der Kontext manipuliert wird.
In Unternehmen könnten ähnliche Techniken eine KI davon überzeugen, dass eine echte Zugriffskontrolle ein „Test“ ist, was möglicherweise zu Datenlecks, unbefugtem Systemzugriff oder Verstößen gegen Richtlinien führen würde.
Während Unternehmen LLMs in ihre Arbeitsabläufe integrieren – vom Kundensupport bis zu DevOps –, stellen Kontextvergiftung und Prompt-Injection eine wachsende Bedrohung dar.
Angreifer könnten diese Schwachstellen ausnutzen, um KI-Tools anzuweisen, vertrauliche Dateien zu verarbeiten, schädlichen Code auszuführen oder nicht erlaubte Inhalte zu erzeugen und dabei den Anschein zu erwecken, die internen Richtlinien einzuhalten.
KI-Schutzvorkehrungen stärken
Integrität und Hygiene des Kontexts und des Speichers
Um solche Risiken zu minimieren, empfehlen Experten die Implementierung von Integritätsprüfungen des Kontexts und Speicherhygienemechanismen, die Daten aus früheren Gesprächen validieren oder bereinigen, bevor sie die Entscheidungen eines Modells beeinflussen. Indem Unternehmen sensible Aufgaben isolieren und eine strikte Herkunftskontrolle für Eingabedaten gewährleisten, können sie die Wahrscheinlichkeit einer Kontextvergiftung verringern.
Kontinuierliches Red Teaming
Unternehmen, die LLMs einsetzen, sollten fortlaufend Red-Team-Übungen durchführen, um Schwachstellen im Verhalten der Modelle zu identifizieren. Proaktive Tests von Agenten mit gegnerischen Eingaben – einschließlich Szenarien mit Prompt-Injection – tragen dazu bei, Richtlinien zu stärken, bevor echte Angreifer sie ausnutzen.
Erkenntnisse aus der Jailbreaking-Forschung
Die Umgehung von CAPTCHAs steht im Einklang mit der umfassenderen Forschung zum „Jailbreaking“ von LLMs. Techniken wie Content Concretization (CC) zeigen, dass Angreifer abstrakte bösartige Anfragen schrittweise zu ausführbarem Code verfeinern können, wodurch sich die Erfolgsquote beim Umgehen von Sicherheitsfiltern erheblich erhöht.
KI-Schutzvorkehrungen müssen über statische Regeln hinausgehen und mehrschichtige Verteidigungsstrategien sowie adaptive Risikobewertungen integrieren.
Die Studie der Cornell University zeigt, dass KI-Systeme bei sorgfältig manipuliertem Kontext ihre eigenen Sicherheitsmechanismen aushebeln und sogar ausgereifte Sicherheitstools wie CAPTCHAs überwinden können.
Während Unternehmen generative KI in großem Maßstab einsetzen, werden robuste Schutzvorkehrungen, die Überwachung des Modellspeichers und Tests gegen fortschrittliche Jailbreaking-Methoden entscheidend sein, um Missbrauch zu verhindern.

