Eines der KI-Modelle von Meta hackte während einer Cybersicherheitsprüfung die Systeme eines anderen Unternehmens, nachdem eine Fehlkonfiguration beim Testen ihm Internetzugang verschafft hatte.
Facebooks Mutterkonzern teilte der BBC mit, dass er Ermittlungen eingeleitet habe und weitere Informationen veröffentlichen wolle, sobald die Fakten geklärt seien.
Jüngste Vorfälle im Zusammenhang mit OpenAI und Anthropic haben die Prüfung verschärft, ob sich Agenten mit Cyber-Fähigkeiten während Tests sicher eindämmen lassen.
Ein Testfehler legte ein Live-System offen
Der unabhängige Evaluator Irregular führte den Test durch und führte den Sicherheitsvorfall auf dasselbe Problem in der Evaluierungsumgebung zurück, das Anthropic vergangene Woche offengelegt hatte, wie die BBC berichtete. Irregular arbeitet an Leitlinien für die sichere Durchführung von Cybersicherheitstests mit KI-Agenten.
Meta teilte Business Insider mit, dass das Modell eine Schwachstelle in einem Dienst eines Drittanbieters ausgenutzt habe und Irregular das Unternehmen über den Vorfall informiert habe. Irregular erklärte, dass es weder einen Ausbruch aus der Sandbox noch eine ausgeklügelte Cyberaktion gegeben habe und keine offenen Fragen mehr bestünden.
Laut The Information war das betreffende Modell Muse Spark 1.1. Meta hat das betroffene Unternehmen nicht genannt, nicht offengelegt, auf welche Systeme zugegriffen wurde, und keine Angaben dazu gemacht, ob Daten offengelegt wurden.
Weitere Vorfälle erhöhen den Druck auf die Eindämmung
OpenAI und Anthropic haben in den vergangenen Wochen ähnliche Vorfälle offengelegt, wobei sich die technischen Abläufe unterschieden. In einem Fall fand ein Agent einen Weg an den Testkontrollen vorbei, während ein anderer mit einem Konfigurationsfehler begann, der den Modellen Internetzugang verschaffte.
In allen Fällen wurden Testumgebungen zu Zugangswegen in Systeme außerhalb des vorgesehenen Geltungsbereichs. Sicherheitsteams sollten öffentlichen Internetzugang und schwache Isolation als Risiken für Sicherheitsvorfälle betrachten, nicht als geringfügige Einrichtungsfehler.
Sicherheitsteams sollten Agenten vor Tests beschränken
Sicherheitsteams, die autonome Agenten testen oder einsetzen, sollten diese vom ersten Durchlauf an als nicht vertrauenswürdige Workloads behandeln.
- Agenten isolieren und Netzwerkzugriffe beschränken. Sie sollten in isolierten Umgebungen ausgeführt, ausgehender Datenverkehr standardmäßig blockiert und nur erforderliche Ziele freigegeben werden.
- Identitäten und Berechtigungen beschränken. Jedem Agenten eine eigene Identität mit kurzlebigen Zugangsdaten zuweisen. Vor der Ausführung von Code oder Änderungen an Systemen die Zustimmung eines Menschen verlangen und den Zugriff auf Geheimnisse blockieren, sofern die Aufgabe dies nicht erfordert.
- Überwachungsdaten bewahren. Prompts und Netzwerkaktivitäten in Protokollen aufzeichnen, die der Agent nicht verändern kann. Jede nicht autorisierte Verbindung sollte die Isolation und den Austausch der Zugangsdaten auslösen, gefolgt von einer vollständigen Überprüfung der Aktivitäten.
- Verantwortlichkeit der Anbieter festlegen. Genehmigte Ziele und Fristen für Benachrichtigungen in Anbietervereinbarungen definieren. Einen verantwortlichen Eigentümer benennen, der den Zugriff im Rahmen einer effektivenAgenten-Governance schnell deaktivieren kann.
Metas geplante nachträgliche Analyse könnte klären, wie der Test scheiterte. Bis dahin sollten Unternehmen, die cyberfähige Agenten einsetzen, prüfen, ob ein einziger Konfigurationsfehler ein Live-System offenlegen könnte und ob ihre Kontrollen dies verhindern würden.
Auch lesenswert: Prompt-Injection wird zu einer zentralen Herausforderung für die KI-Sicherheit, da Angreifer auf die Anweisungen zielen, auf die sich Modelle verlassen.





