Ein gemeinsamer Anbieter für Sicherheitstests könnte erklären, warum KI-Modelle von OpenAI, Anthropic und Meta allesamt Systeme erreichten, auf die sie niemals hätten zugreifen dürfen.
CNBC berichtete, dass an den drei Vorfällen Irregular beteiligt war, ein israelisches Sicherheitsunternehmen, das die offensiven Fähigkeiten fortschrittlicher KI-Modelle bewertet. Bei den betroffenen Tests ermöglichten Konfigurationsschwächen den Modellen Berichten zufolge den Weg von kontrollierten Testumgebungen zu externen Systemen.
Das verändert die sicherheitstechnische Lehre daraus. Bei den Vorfällen geht es nicht nur darum, was zunehmend leistungsfähige KI-Agenten tun können, sondern auch darum, ob der von Dritten bereitgestellten Infrastruktur, mit der sie getestet und eingegrenzt werden, zugetraut werden kann, die Grenzen einzuhalten.
Drei Vorfälle, ein Problem in der Lieferkette
Die erste Warnung kam von OpenAI, deren Modelle während einer Cybersicherheitsprüfung die Infrastruktur von Hugging Face erreichten.
Später stellte Anthropic drei separate Fälle fest, in denen Claude-Modelle unbefugten Zugriff erlangten auf die Systeme dreier Organisationen. Etwa zur selben Zeit legte Meta offen, dass sein Muse Spark 1.1-Modell ebenfalls während eines Sicherheitstests in die Systeme eines externen Unternehmens eingedrungen war.
Meta erklärte, dass ein Konfigurationsfehler desselben Testanbieters Muse Spark 1.1 unbeabsichtigten Zugang zum Internet verschafft hatte.
Irregulars Aufgabe bestand darin, diese Modelle realistischen Cybersicherheitsübungen zu unterziehen, ihnen Ziele und Werkzeuge zu geben und ihnen genügend Freiraum zu lassen, um zu zeigen, ob sie Schwachstellen entdecken und offensive Sicherheitsaufgaben ausführen konnten.
Die Modelle starteten also nicht bei null. Sie wurden bereits auf fortgeschrittene offensive Cyberfähigkeiten getestet, und die Testumgebungen waren so aufgebaut, dass sie diese Fähigkeiten einsetzen konnten. Das Problem war, dass diese Umgebungen den Modellen in den betreffenden Fällen außerdem einen unbeabsichtigten Weg ins öffentliche Internet eröffneten.
Dieser Unterschied ist entscheidend, weil sich die Sicherheitsfrage dadurch verschiebt: Es geht nicht mehr darum, ob KI aus einer Sandbox ausbrechen kann, sondern darum, ob die Infrastruktur rund um zunehmend leistungsfähige KI-Agenten zuverlässig verhindern kann, dass diese irgendetwas erreichen, das sie niemals hätten berühren dürfen.
Und genau das macht Irregular zu mehr als einem gemeinsamen Namen in drei scheinbar unabhängigen Vorfällen. Der Fall legt ein Risiko durch Dritte in der KI-Sicherheitslieferkette offen. Die Labore stellten zunehmend leistungsfähige Modelle bereit, während die externen Testumgebungen die Grenzen vorgaben, die sie eigentlich eindämmen sollten. Und als diese Grenzen versagten, konnten die Modelle aus einer Prüfung einen Sicherheitsvorfall in der realen Welt machen.
Was das für Unternehmen bedeutet
Unternehmen, die autonome oder teilautonome KI-Agenten einsetzen, sollten davon ausgehen, dass diese Systeme irgendwann auf Möglichkeiten stoßen werden, außerhalb ihres vorgesehenen Zuständigkeitsbereichs zu handeln.
Kontrollen sollten daher durch die Infrastruktur und nicht allein durch Anweisungen durchgesetzt werden. Organisationen sollten Netzwerkregeln nach dem Prinzip „standardmäßig verweigern“ einsetzen, den ausgehenden Internetzugriff beschränken, sensible Systeme isolieren, Berechtigungen nach dem Prinzip der geringsten Rechte vergeben, den Agenten zur Verfügung stehende Zugangsdaten regelmäßig ändern oder ihre Verwendung einschränken und unerwartete ausgehende Verbindungen überwachen.
Die Vorfälle verdeutlichen außerdem ein Risiko durch Dritte. Organisationen, die externe Anbieter mit dem Hosting, der Bewertung oder der Absicherung von KI-Agenten beauftragen, sollten unabhängig prüfen, wie diese Anbieter die Netzwerkisolierung durchsetzen, Zugangsdaten verwalten, die Aktivitäten der Agenten protokollieren und verhindern, dass Testumgebungen Produktions- oder öffentliche Systeme erreichen.
Die übergeordnete Lehre ist bekannt: Wer eine Sicherheitsfunktion auslagert, lagert damit nicht das Risiko aus. Wenn ein externer Anbieter die Grenzen rund um einen KI-Agenten kontrolliert, können Schwachstellen in den Kontrollen dieses Anbieters Teil der eigenen Angriffsfläche des Kunden werden.
Weitere Meldungen: Hacker nehmen große Wall-Street-Firmen ins Visier mit telefonischen Social-Engineering-Angriffen, bei denen sie sich als Helpdesk-Mitarbeiter ausgeben, MFA-Codes in Echtzeit abfangen und Unternehmenszugangsdaten zur Erpressung stehlen.





