NVIDIA-NemoClaw-Forschung beleuchtet Risiken der Datenexfiltration aus KI-Sandboxen

Forscher zeigten, wie Angreifer Daten von KI-Agenten innerhalb von NVIDIA-NemoClaw-Umgebungen stehlen könnten.

Written By
Ken Underhill
Ken Underhill
May 13, 2026
5 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Forscher von Lasso haben festgestellt, dass die Sandbox-Isolierung autonomer KI-Agenten möglicherweise nicht ausreicht, um den Diebstahl sensibler Daten zu verhindern. Dies zeigten sie anhand mehrerer Exfiltrationstechniken gegen die Umgebungen NVIDIA NemoClaw und OpenShell. 

Die Ergebnisse zeigen, wie Angreifer vertrauenswürdige Tools und genehmigte ausgehende Verbindungen missbrauchen können, um unbemerkt Zugangsdaten zu stehlen, das Verhalten von Agenten zu manipulieren und Persistenz innerhalb von KI-Laufzeitumgebungen aufrechtzuerhalten.

„In den vergangenen Monaten haben wir einen starken Anstieg von Mitarbeitern beobachtet, die persönliche KI-Agenten innerhalb von Unternehmen entwickeln und einsetzen – häufig ohne dass das Unternehmen überhaupt davon weiß“, sagte Noy Pearl, KI- und Sicherheitsforscherin bei Lasso, in einer E-Mail an eSecurity Planet.  

Sie erklärte: „Diese Forschung zeigt, dass die Einschränkung der Umgebung eines Agenten das Risiko nicht beseitigt, wenn dieser Agent autonom Entscheidungen treffen, auf verbundene Ressourcen zugreifen und mit externen Systemen interagieren kann.“

Noy fügte hinzu: „Gerade die Eigenschaften, die KI-Agenten in Produktivumgebungen wertvoll machen, werden auch von Angreifern ins Visier genommen.“

Zentrale Erkenntnisse der KI-Sandbox-Forschung

  • Die Forscher zeigten, dass eine Sandbox-Isolierung von KI allein die Datenexfiltration aus autonomen KI-Agenten möglicherweise nicht verhindern kann.
  • Bei den Angriffen wurden vertrauenswürdige Tools wie GitHub, npm und genehmigte Binärdateien missbraucht, anstatt eine herkömmliche Softwareschwachstelle auszunutzen.
  • Sensible Daten, darunter API-Schlüssel, Umgebungsvariablen und OpenClaw-Zugangsdaten, konnten über genehmigte ausgehende Kanäle exfiltriert werden.
  • Bei einem Proof-of-Concept-Angriff wurde durch Agent Configuration Poisoning Persistenz hergestellt und das Verhalten des KI-Agenten verändert.
  • Die Ergebnisse verdeutlichen die wachsenden Bedenken hinsichtlich der Sicherheit der KI-Lieferkette, vertrauenswürdiger Workflows und des Risikomanagements für autonome Agenten.

Angriffe auf die NemoClaw-KI-Sandbox

Die Forschung beleuchtet wachsende Sicherheitsrisiken für Unternehmen, die autonome KI-Agenten einsetzen, welche mit minimaler Überwachung Pakete installieren, auf Dateien zugreifen und Code ausführen können.  

Advertisement

Obwohl NVIDIA OpenShell eine Kubernetes-basierte Sandbox-Isolierung und Richtlinienkontrollen nutzt, um KI-Workloads zu isolieren, stellten die Forscher fest, dass dessen vertrauenswürdige Funktionen weiterhin für bösartige Aktivitäten missbraucht werden konnten. 

Im Zentrum des Problems steht die Tatsache, dass autonome KI-Agenten mit externen Tools und Diensten interagieren müssen, um nützlich zu bleiben. 

Vorgänge wie die Ausführung von npm install, der Zugriff auf GitHub-Repositories, die Ausführung von Skripten und die Kommunikation mit APIs erfordern naturgemäß eine ausgehende Verbindung und Zugriff auf genehmigte Binärdateien. 

Die Forscher entdeckten, dass Angreifer diese legitimen Workflows missbrauchen konnten, um sensible Daten unbemerkt aus der Sandbox zu exfiltrieren, ohne die Sicherheitskontrollen von OpenShell direkt zu umgehen.

Die Ergebnisse bekräftigen die allgemeinen Bedenken hinsichtlich der Sicherheit der KI-Lieferkette und des sich wandelnden Vertrauensmodells für autonome Agenten. 

Im Gegensatz zu herkömmlichen Anwendungen, die innerhalb relativ vorhersehbarer Grenzen arbeiten, beziehen KI-Agenten häufig Code aus öffentlichen Repositories, installieren dynamisch Pakete und treffen in Echtzeit eigenständige betriebliche Entscheidungen. 

Dieses Verhalten vergrößert die Angriffsfläche und eröffnet Angreifern neue Möglichkeiten, vertrauenswürdige Entwicklungs-Workflows auszunutzen.

Proof-of-Concept-Angriffe nutzten vertrauenswürdige Workflows aus

Die Forscher beschrieben zwei Proof-of-Concept-Angriffsszenarien, bei denen richtlinienkonforme Kommunikationskanäle genutzt wurden, anstatt eine Schwachstelle in OpenShell selbst auszunutzen. 

Im ersten Szenario lieferte ein von einem Angreifer kontrolliertes GitHub-Repository während eines routinemäßigen postinstall.sh-Skripts einen bösartigen npm install-Prozess. 

Das Skript verwendete eine auf Emojis basierende Verschleierung, um zur Laufzeit ein codiertes GitHub-Token zu rekonstruieren, wodurch es sowohl den Schutz durch die Geheimnisüberprüfung von GitHub als auch die Erkennungsmechanismen von OpenClaw umgehen konnte. 

Nach der Decodierung ermöglichte das Token dem Skript, autorisierte git- und gh-Binärdateien zu verwenden, um einen Pull Request mit sensiblen, aus der Sandbox-Umgebung gestohlenen Dateien zu erstellen.

Die Forscher identifizierten /sandbox/.openclaw/openclaw.json als besonders wertvolles Ziel, da die Datei OpenClaw-Zugangsdaten und API-Schlüssel im Klartext speichert. 

Advertisement

Die Angriffsfläche beschränkte sich jedoch nicht auf eine einzelne Datei. 

Die Forscher warnten, dass auch Umgebungsvariablen, API-Token, Cloud-Zugangsdaten und Schlüssel für KI-Plattformen über genehmigte ausgehende Kanäle exfiltriert werden könnten.  

Persistente Exfiltration und Agent Configuration Poisoning

Das zweite Szenario zeigte, wie Angreifer durch ein bösartiges NPM-Paket eine persistente Exfiltration und eine langfristige Manipulation des KI-Agenten selbst einrichten konnten. 

Nach der Installation richtete das Paket einen Cronjob ein, der kontinuierlich die OpenShell-Richtlinien prüfte, um genehmigte Binärdateien und zulässige Domains für die ausgehende Kommunikation zu ermitteln. 

Die Schadsoftware veränderte außerdem die SOUL.md-Konfigurationsdatei des Agenten, um dessen künftiges Verhalten zu verändern – eine Technik, die die Forscher als „Agent Configuration Poisoning“ bezeichneten. 

Dadurch konnte der Angreifer potenziell künftige Entscheidungen des KI-Agenten beeinflussen, ihn etwa zu bösartigen Paketen lenken oder seine Reaktion auf Prompts manipulieren.

Wichtig ist, dass die Angriffe erfolgreich waren, ohne die konfigurierten OpenShell-Richtlinien zu verletzen. 

Stattdessen missbrauchten sie Funktionen, die die Sandbox für den normalen KI-Betrieb bewusst zulässt, darunter die Installation von Abhängigkeiten, den GitHub-Zugriff, die Paketverwaltung und die Kommunikation mit externen APIs. 

Die Forschung unterstreicht eine zentrale Einschränkung richtlinienbasierter Sandbox-Modelle: Sie können zwar einschränken, wohin ein KI-Agent kommuniziert, aber nicht die Absicht hinter seinen Aktionen bestimmen, sobald vertrauenswürdige Tools und genehmigte Wege verfügbar sind.

So können Unternehmen KI-Risiken reduzieren

Unternehmen, die mit autonomen KI-Agenten experimentieren, sollten die Sandbox-Isolierung nicht als alleinstehende Sicherheitskontrolle betrachten.  

  • Beschränken Sie ausgehende Verbindungen, Binärdateien und den Internetzugriff auf die Ressourcen, die für genehmigte Betriebsabläufe von KI-Agenten erforderlich sind.
  • Implementieren Sie Zugriffskontrollen nach dem Prinzip der geringsten Privilegien und speichern Sie Zugangsdaten in sicheren Plattformen zur Geheimnisverwaltung. Verwenden Sie dabei kurzlebige Token anstelle von Schlüsseln im Klartext.
  • Überwachen Sie KI-Laufzeitumgebungen auf ungewöhnliches Verhalten, darunter verdächtige Paketinstallationen, nicht autorisierte Konfigurationsänderungen, Prompt-Injection-Versuche und ungewöhnliche API-Aktivitäten.
  • Verwenden Sie geprüfte interne Repositories, eine Überprüfung von Abhängigkeiten und kryptografische Signaturen, um Risiken durch die Software-Lieferkette und bösartige Pakete zu reduzieren.
  • Setzen Sie kurzlebige Sandbox-Umgebungen ein, überwachen Sie die Dateiintegrität und segmentieren Sie Netzwerke, um Möglichkeiten für Persistenz und laterale Bewegungen einzuschränken.
  • Verlangen Sie eine menschliche Genehmigung für sensible Aktionen wie die Codeausführung, die Installation von Abhängigkeiten, Änderungen an Repositories und Modifikationen an der Infrastruktur.
  • Testen Sie Notfallpläne und verwenden Sie Angriffssimulations-tools mit Szenarien zu Angriffen auf KI-Agenten.
Advertisement

Zusammengenommen können diese Maßnahmen Unternehmen dabei helfen, ihre Widerstandsfähigkeit gegen Bedrohungen durch KI-Agenten zu stärken und gleichzeitig unnötige Risiken in autonomen Entwicklungsumgebungen zu reduzieren. 

KI-Sandboxen reichen nicht aus

Die NemoClaw-Forschung spiegelt umfassendere Veränderungen wider, die sich derzeit in den Bereichen KI und Cybersicherheit vollziehen. 

Herkömmliche Sandbox-Umgebungen wurden für vorhersehbare Anwendungen entwickelt, die innerhalb definierter Grenzen arbeiten. 

Autonome KI-Agenten stellen neue Herausforderungen dar, weil sie regelmäßig mit externen Tools, Repositories und Code von Drittanbietern interagieren und dabei in Echtzeit eigenständige Entscheidungen treffen. 

Da KI-Programmierassistenten und agentische Systeme immer häufiger eingesetzt werden, verlassen sich Unternehmen zunehmend auf Workflows, die mit GitHub-Repositories, npm-Paketen und externen Integrationen verknüpft sind. 

Die Forscher erklären, dass diese Entwicklung die potenzielle Angriffsfläche vergrößert und die Grenzen einer ausschließlich richtlinienbasierten Isolierung zur Absicherung autonomer KI-Umgebungen aufzeigt.

Die Ergebnisse unterstreichen auch, warum Unternehmen Zero Trust nutzen, um Risiken zu reduzieren und die Transparenz in autonomen KI-Umgebungen zu verbessern.

Ken Underhill

Ken Underhill is an award-winning cybersecurity professional, bestselling author, and seasoned IT professional. He holds a graduate degree in cybersecurity and information assurance from Western Governors University and brings years of hands-on experience to the field.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.