Anthropics jüngstes Claude-KI-Upgrade steigert die Produktivität … und führt Sicherheitsrisiken ein.
Die neue Funktion des Unternehmens zur Dateierstellung ermöglicht die Dokumentengenerierung direkt im Chat, doch Anthropics eigene Dokumentation warnt, dass sie ein Risiko für Nutzerdaten darstellen kann.
In seiner jüngsten Warnung erklärte Anthropic: „Es ist möglich, dass ein böswilliger Akteur unauffällig Anweisungen über externe Dateien oder Websites einschleust, die Claude dazu bringen, nicht vertrauenswürdigen Code herunterzuladen und auszuführen sowie vertrauliche Daten zu lesen und/oder offenzulegen.“
Was ist die neue Funktion?
Die erweiterte Funktion zur Dateierstellung und -analyse bietet Claude eine abgeschottete Computerumgebung mit eingeschränktem Internetzugang.
Dieses Design ermöglicht es dem Assistenten, Abhängigkeiten aus Repositories abzurufen und Code auszuführen. Das steigert zwar den Funktionsumfang, eröffnet aber auch eine neue Angriffsfläche für bösartige Anweisungen.
Das Risiko von Prompt Injection
Der wichtigste Angriffsvektor ist Prompt Injection. Prompt-Injection-Angriffe nutzen die Tatsache aus, dass große Sprachmodelle sämtliche Eingaben – Daten, Anweisungen und verborgene Direktiven – als Teil desselben Kontexts behandeln.
Angreifer können bösartige Befehle in hochgeladene Dateien, verlinkte Websites oder sogar harmlos wirkenden Text einbetten. Wenn Claude diese Eingaben verarbeitet, können die verborgenen Anweisungen den Nutzerwillen überschreiben und unsichere Aktionen auslösen.
Anthropic warnt, dass Prompt Injection Claude dazu bringen könnte, nicht vertrauenswürdigen Code auszuführen, da die Sandbox von Haus aus die Ausführung beliebiger Skripte zur Dateigenerierung unterstützt.
Eine weitere Sorge ist, dass Angreifer vertrauliche Daten extrahieren könnten. Wenn Claude mit Wissensquellen wie Projektdateien, MCP-Integrationen oder mit der Cloud verknüpften Daten verbunden ist, könnte eine Prompt Injection das Modell anweisen, vertrauliche Inhalte zu analysieren und offenzulegen.
Da das Modell nicht zuverlässig zwischen „Teile dies nicht“ und „Kopiere dies in eine externe Ausgabe“ unterscheiden kann, könnten vertrauliche Informationen unbeabsichtigt offengelegt werden.
Prompt Injection kann auch die Datenexfiltration ermöglichen. Mit seinem eingeschränkten Internetzugang könnte Claude dazu manipuliert werden, ausgehende HTTP-Anfragen zu stellen, die gestohlene Daten an von Angreifern kontrollierte Server übertragen. Dadurch könnten geschützte Dokumente, API-Schlüssel oder andere vertrauliche Informationen über einen verdeckten externen Kanal nach außen gelangen.
Diese Risiken entstehen, weil die Sandbox Claude genügend Autonomie für sinnvolle Berechnungen und Netzwerkaktivitäten gewährt, ohne starke Sicherheitsvorkehrungen bereitzustellen.
Wie geht Anthropic mit dem Problem um?
Auch wenn Anthropic die Aufgabedauer begrenzt, Enterprise-Sandboxes isoliert und Positivlisten für ausgehende Domains bereitstellt, handelt es sich dabei lediglich um Maßnahmen zur Risikominderung und nicht um einen vollständigen Schutz. Wenn ein Nutzer die Funktion bei der Arbeit mit vertraulichen Unternehmensdaten aktiviert, könnte eine geschickt präparierte Datei oder ein entsprechend präparierter Link die menschliche Kontrolle umgehen und Informationen nach außen übertragen.
Diese Schwachstelle macht die ungelöste Herausforderung der Sicherheit von Kontextfenstern deutlich: Modelle verarbeiten Daten und Anweisungen gemeinsam, wodurch es schwierig ist, bösartige Eingaben zu blockieren, ohne gültige Aufgaben zu beeinträchtigen. Damit wird jede angebundene Integration zu einem potenziellen Vektor für Datenlecks.
Anthropics Entscheidung, eine Funktion mit dokumentierten Schwachstellen zu veröffentlichen, unterstreicht die in der KI-Branche vorherrschende Mentalität „erst ausliefern, später absichern“.
Der unabhängige Forscher Simon Willison kritisierte den Ansatz und schrieb, Anthropics Aufforderung an die Nutzer, „Claude während der Verwendung der Funktion zu überwachen“, sei eine „unfaire Auslagerung des Problems“.
So senken Sie Ihr Risiko
Anthropic hat einige Maßnahmen zur Risikominderung eingeführt, darunter die Isolation von Sandboxes für Unternehmenskunden, die Deaktivierung der öffentlichen Freigabe von Unterhaltungen mit dieser Funktion sowie eine Begrenzung der Aufgabedauer, um Missbrauchsschleifen zu verhindern.
Sicherheitsteams können die Risiken von Claudes Dateierstellungsfunktion durch die folgenden proaktiven Maßnahmen weiter reduzieren:
- Prüfen Sie Claudes Bereitstellungen und entscheiden Sie abhängig von der Sensibilität der verarbeiteten Daten, ob Sie die Dateierstellung aktivieren.
- Setzen Sie Positivlisten durch für ausgehende Netzwerkanfragen und überprüfen Sie die Sandbox-Aktionen regelmäßig.
- Überwachen Sie Aktivitätsprotokolle auf Anzeichen für unbefugten Datenzugriff oder Exfiltrationsversuche.
- Schulen Sie Ihre Mitarbeitenden zu den Gefahren von Prompt Injection und erstellen Sie Notfallpläne für den Missbrauch von KI.
Für Prompt Injection gibt es weiterhin keine dauerhafte Lösung. Ohne mehrschichtige Schutzmechanismen bleiben KI-Tools daher anfällig für Datenlecks. Die zentrale Erkenntnis: Fortschritt bei KI bedeutet, Sicherheit in jede Ebene einzubetten, statt sie nachträglich aufzusetzen.
KI ist nicht immer nur ein Risiko – sie kann Ihrem Sicherheitsteam helfen. Entdecken Sie einige der wichtigsten Herausforderungen und Vorteile von KI in der Cybersicherheit.

