Anthropics Claude AI, genauer gesagt das Tool Code Interpreter mit seinen neuen Netzwerkfunktionen, lässt sich durch indirekte Prompt-Injection manipulieren, um sensible Nutzerdaten zu stehlen.
Sicherheitsforscher Johann Rehberger enthüllte im Oktober 2025, dass Angreifer diese Funktionen ausnutzen könnten, um Chatverläufe zu extrahieren und direkt in ihre eigenen Konten hochzuladen.
Die Entdeckung unterstreicht die wachsenden Bedenken darüber, wie die zunehmende Vernetzung von KI neue Sicherheitsrisiken schafft.
Die Schwachstelle
Die Schwachstelle liegt in Claudes standardmäßiger Netzwerkeinstellung „Nur Paketmanager“. Sie erlaubt den Zugriff auf eine kleine Liste freigegebener Domains, darunter api[.]anthropic[.]com.
Diese Konfiguration sollte es Claude ermöglichen, Softwarepakete sicher aus vertrauenswürdigen Quellen wie npm, PyPI und GitHub zu installieren.
Rehberger zeigte jedoch, dass diese Konfiguration missbraucht werden konnte, um eine Hintertür in Claudes Systeme einzurichten.
Indem ein Angreifer bösartige Anweisungen in eine harmlos wirkende Datei oder Nachricht einbettet, kann er Claude dazu bringen, verborgenen Code auszuführen.
Diese indirekte Prompt-Injection veranlasst das Modell, Nutzerdaten zu lesen, sie in einer Datei innerhalb seiner Sandbox zu speichern und die eigenen APIs von Anthropic zu verwenden, um diese Datei an das Konto des Angreifers zu senden.
So funktioniert der Angriff
Rehbergers Proof of Concept beginnt damit, dass das Opfer Claude bittet, ein manipuliertes Dokument zu analysieren.
Die eingebettete Nutzlast weist Claude an, aktuelle Chatdaten zusammenzutragen, sie in der Sandbox in eine Datei namens hello.md zu schreiben und sie anschließend mithilfe des Anthropic SDK hochzuladen.
Mithilfe des API-Schlüssels des Angreifers sendet Claude die gestohlene Datei unwissentlich – bis zu 30 MB pro Upload – an die Anthropic Console des Angreifers.
Mehrere Uploads können nacheinander erfolgen und so groß angelegten Datendiebstahl ermöglichen.
Rehberger zufolge war der Exploit zunächst problemlos erfolgreich, doch spätere Versionen von Claude begannen, offensichtliche API-Schlüssel als verdächtig zu kennzeichnen.
Um dies zu umgehen, tarnte er den bösartigen Code in harmlosen Print-Anweisungen und brachte Claude so dazu, ihn erneut auszuführen.
Anthropics Reaktion
Rehberger meldete das Problem verantwortungsvoll über HackerOne.
Zunächst tat Anthropic es als Problem der „Modellsicherheit“ ab und stufte es als außerhalb des Geltungsbereichs der Schwachstellenmeldung ein.
Nach der öffentlichen Diskussion räumte das Unternehmen am 30. Oktober das Versäumnis ein und bestätigte den Fund als gültiges Sicherheitsproblem.
In der Dokumentation von Anthropic wurde bereits vor der Möglichkeit eines Datenabflusses über ausgehenden Netzwerkverkehr gewarnt. Das Unternehmen empfiehlt, Claude-Sitzungen zu überwachen und die Aktivität zu beenden, wenn ungewöhnliches Verhalten festgestellt wird.
Sicherheitsexperten haben diesen Exploit als Teil des tödlichen Dreiergespanns der KI-Sicherheitsrisiken bezeichnet: leistungsfähige Modelle, externe Vernetzung und promptbasierte Steuerung.
Da sich KI-Tools wie Claude immer stärker in professionelle Arbeitsabläufe integrieren, kann selbst ein eingeschränkter Netzwerkzugriff für Angreifer zu einer offenen Tür werden.
Rehbergers Erkenntnisse zeigen, dass sich etwas, das als Komfortfunktion gedacht ist – etwa die Paketinstallation –, zu einer ernsthaften Sicherheitslücke entwickeln kann.
Wenn KI-Systeme ausgehende Netzwerkaufrufe ohne strenge Verifizierung des Nutzers durchführen dürfen, besteht das Risiko eines direkten Datendiebstahls.
Künftige Angriffe verhindern
Für Anthropic und andere KI-Entwickler sollte die Abwehr mit der Durchsetzung strenger Sandbox-Kontrollen beginnen, die API-Aufrufe auf das eigene authentifizierte Konto des Nutzers beschränken.
Positivlisten sollten auf ein Minimum reduziert und sorgfältig geprüft werden, um unbeabsichtigte Zugriffswege auszuschließen.
Endnutzer können sich schützen, indem sie den Netzwerkzugriff nach Möglichkeit deaktivieren, nur notwendige Domains zulassen und die Sitzungsaktivität sorgfältig auf ungewöhnliche Dateierstellungen oder Codeausführung überwachen.
Sensible Daten sollten niemals über KI-Tools mit aktivierten Netzwerkberechtigungen verarbeitet werden, sofern nicht zuvor starke Schutzmaßnahmen bestätigt wurden.
Die übergeordnete Lehre
Der Claude-Exploit verdeutlicht eine entscheidende Wahrheit über moderne KI-Systeme: Vernetzung bringt sowohl Möglichkeiten als auch Risiken.
Je mehr Modelle in der Lage sind, Code auszuführen, Daten abzurufen und mit Onlinesystemen zu interagieren, desto schmaler wird die Grenze zwischen hilfreicher Automatisierung und schädlichem Missbrauch.
Ohne angemessene Kontrolle können selbst vertrauenswürdige KI-Assistenten in Werkzeuge zum Abfluss von Daten verwandelt werden.
Der Vorfall dient Entwicklern und Nutzern gleichermaßen als Warnung – im Zeitalter vernetzter KI, muss jede Funktion so abgesichert werden, als könnte sie als Waffe missbraucht werden.





