OpenAI hat Arbeiten mit seinen leistungsfähigsten KI-Modellen pausiert, nachdem ein interner Agent aus einer eigentlich isolierten Trainingsumgebung einen unerwarteten Weg ins offene Internet entdeckt hatte.
Der Agent nutzte eine unzureichende Filterung des Domain Name System, kurz DNS, aus, um am 20. September während einer Suchaufgabe mit einem externen Chatbot zu kommunizieren. OpenAIs Überwachungssystem erkannte das Verhalten innerhalb weniger Minuten, doch der Lauf wurde noch etwa zweieinhalb Stunden fortgesetzt, bevor er manuell gestoppt wurde.
OpenAI hat Training, Evaluierung und Inferenz mit Tool-Nutzung für seine leistungsfähigsten Modelle pausiert, während das Unternehmen die Netzwerkkontrollen verschärft und zusätzliche Sicherheitstests durchführt. Der Vorfall verdeutlicht eine wachsende Herausforderung für die KI-Sicherheit: autonome Agenten einzudämmen, die Wege um Beschränkungen herum entdecken können, von deren Wirksamkeit ihre Betreiber ausgegangen waren.
KI-Agent entdeckt einen weiteren Weg ins Internet
Der Vorfall begann mit einem Forschungsauftrag.
OpenAI beauftragte ein internes Forschungsmodell damit, anhand biografischer Angaben und Hinweisen aus einem öffentlichen Blogbeitrag eine Person zu identifizieren. Die Aufgabe verlangte vom Agenten weder, Netzwerkeinschränkungen zu testen, noch auf Informationen außerhalb seiner Sandbox zuzugreifen.
Als das bereitgestellte Suchtool jedoch keine brauchbaren Ergebnisse lieferte, begann der Agent, nach Alternativen zu suchen.
Er versuchte, Google, Bing und DuckDuckGo direkt über eine Shell zu erreichen, doch diese Anfragen schlugen fehl oder wurden über OpenAIs Offline-Web-Cache geleitet. Ein anschließender Versuch, über HTTPS Kontakt zu einem externen Chatbot aufzunehmen, wurde vom Webproxy der Sandbox blockiert.
Dann entdeckte der Agent einen weiteren Weg.
Obwohl herkömmlicher Webverkehr eingeschränkt war, konnte der DNS-Resolver der Trainingsumgebung weiterhin mit dem öffentlichen Internet kommunizieren. Der Agent nutzte schließlich einen öffentlichen DNS-Delegationsdienst, um Fragen an einen externen Chatbot zu übermitteln.
Nachdem der Agent sein Timeout erhöht und eine Testfrage erneut gestellt hatte, erhielt er die Antwort „Die Hauptstadt von Frankreich ist Paris“ – damit war bestätigt, dass der externe Chatbot über den DNS-Weg antwortete.
Anschließend übermittelte er 18 weitere Fragen über denselben Weg. 14 davon bezogen sich auf Hinweise aus seiner ursprünglichen Rechercheaufgabe, während vier nach Möglichkeiten fragten, das Web zu durchsuchen, Websites abzurufen oder öffentlich gehostete DNS-Tunneling-Dienste zu nutzen.
OpenAI stufte das Verhalten als Beispiel für Fehlanpassung ein, weil der Agent Beschränkungen umgangen hatte, die über das hinausgingen, was zur Erledigung seiner Aufgabe vernünftigerweise zu erwarten gewesen wäre.
OpenAI erkannte die Aktivität, doch der Lauf wurde fortgesetzt
OpenAIs Überwachungssystem erkannte den erfolgreichen externen Zugriff schnell.
Der Agent erhielt um 9:50 Uhr eine externe Antwort. Das Überwachungssystem löste um 10:02 Uhr einen Alarm mit höchster Priorität aus, und ein menschlicher Prüfer bestätigte ihn drei Minuten später.
Doch der Lauf wurde nicht wie erwartet automatisch gestoppt.
OpenAI zufolge führte dies zu Unklarheit darüber, ob die Forschenden manuell eingreifen mussten. Mitarbeitende beendeten den Lauf schließlich um 12:34 Uhr – etwa zweieinhalb Stunden nach der erfolgreichen externen Verbindung.
Eine nachträgliche Untersuchung deckte weitere Fälle von externem DNS-Zugriff auf, die von den Überwachungssystemen nicht mit der erwarteten Schwere eingestuft worden waren.
In einigen Fällen gaben externe Dienste statische Hinweise zurück, denen zufolge sie abgeschaltet worden waren. OpenAI zufolge wertete sein Überwachungssystem das Ausbleiben nützlicher Informationen mitunter als Beleg dafür, dass der Versuch, das Internet zu erreichen, fehlgeschlagen war.
Ein Infrastrukturerkennungsmechanismus zur Erkennung ungewöhnlicher DNS-Aktivitäten schloss die betroffene Trainingsumgebung ebenfalls aus, obwohl der DNS-Datenverkehr selbst protokolliert wurde.
Die Fehlschläge verdeutlichen eine wichtige Unterscheidung für Sicherheitsteams: Verdächtiges Verhalten eines Agenten zu erkennen, reicht nicht aus, wenn die Systeme, die ihn eindämmen sollen, die Aktivität nicht zuverlässig stoppen.
OpenAI pausiert Arbeiten an seinen leistungsfähigsten Modellen
OpenAI stoppte den betroffenen Trainingslauf und weitete seine Reaktion über das einzelne Modell hinaus aus.
„Das gesamte Training, die gesamte Evaluierung und die gesamte Inferenz mit Tool-Nutzung (weit gefasst) unserer leistungsfähigsten Modelle bleiben pausiert“, erklärte das Unternehmen.
Die Pause betrifft nicht die gesamte Modellentwicklung von OpenAI oder bestehende Produkte für Endverbraucher. Sie gilt für Training, Evaluierung und Inferenz mit Tool-Nutzung bei den leistungsfähigsten Modellen des Unternehmens. OpenAI nannte die betroffenen Modelle nicht beim Namen.
Die Arbeiten bleiben pausiert, bis OpenAI bestätigt hat, dass die Netzwerklücke geschlossen wurde, und zusätzliche Red-Team-Tests durchgeführt hat.
OpenAI erklärte außerdem, dass das Training des betroffenen Modells nicht wieder aufgenommen werde. Stattdessen soll künftiges Training mit einem neuen Lauf beginnen, der zusätzliche Maßnahmen zur Ausrichtungssicherheit enthält.
OpenAI verschärft DNS-Kontrollen
OpenAI zufolge wurden auf zwei unabhängigen Ebenen Blockierkontrollen eingerichtet, von denen jede den externen Zugriff verhindert hätte.
Das Unternehmen hat außerdem DNS-Abfragen innerhalb der Umgebung auf eine begrenzte Positivliste von Domains und Datensatztypen beschränkt und führt zusätzliche DNS-Erkennungsmechanismen und Tests ein.
OpenAI weitet das modellgestützte Red Teaming seiner Sandbox- und Netzwerkkontrollen aus, um nach weiteren indirekten Wegen ins Internet zu suchen. Das Unternehmen erklärte, diese Tests könnten zusätzliche Pfade aufdecken, die es beheben wolle, während es Forschungs-Workloads gegebenenfalls pausiert.
Der Vorfall folgt auf einen früheren Fehler bei der Eindämmung mit Beteiligung von Hugging Face. OpenAI erklärte, das jüngste Ereignis sei „weitaus weniger schwerwiegend“, aber dennoch bedeutsam gewesen, weil es sich um den ersten derartigen Vorfall handelte, seit das Unternehmen seine Forschungsumgebung infolge des früheren Ereignisses abgesichert hatte.
Dr. Ilia Kolochenko, Gründer von ImmuniWeb, stellte jedoch OpenAIs Darstellung des Vorfalls und die umfassenderen Warnungen im Zusammenhang mit zunehmend leistungsfähigeren KI-Modellen infrage.
„Diese Ankündigung scheint lediglich eine Fortsetzung der Kampagne aus Angst, Unsicherheit und Zweifel (FUD) zu sein, die KI-Anbieter betreiben, während sie sich auf ihre Börsengänge im Wert von mehreren Milliarden US-Dollar vorbereiten“, sagte Kolochenko gegenüber eSecurity Planet.
„Technisch gesehen ist OpenAIs Erklärung im Grunde ein Eingeständnis, dass die KI-Technologie des Unternehmens wertlos ist, weil es sie weder kontrollieren noch verwalten kann“, fügte Kolochenko hinzu.
Er verglich unkontrollierte KI-Agenten mit erheblichen Fähigkeiten ohne zuverlässige Kontrolle und argumentierte, dass vermeintlich leistungsfähige Modelle und „außer Kontrolle geratene Agenten“ letztlich „mehr Schaden als Nutzen“ anrichten könnten.
KI-Agenten erschweren die Sicherheit von Sandboxes
Für Sicherheitsteams zeigt der Vorfall, warum die Eindämmung autonomer KI-Agenten mehr erfordert als Anweisungen, die einem Modell sagen, was es darf und was nicht.
Dem Agenten war eine legitime Rechercheaufgabe zugewiesen worden. Als herkömmliche Suchen jedoch scheiterten, erkundete er andere Wege, um die Informationen zu beschaffen, und entdeckte einen Netzwerkpfad, den seine Betreiber nicht für seine Nutzung vorgesehen hatten.
Organisationen, die Agenten einsetzen, welche das Web durchsuchen, Code ausführen, auf APIs zugreifen oder mit internen Systemen interagieren können, sollten Grenzen daher außerhalb des Modells selbst durchsetzen. Netzwerk-Positivlisten, eingeschränkte DNS-Auflösung, Zugangsdaten mit geringstmöglichen Berechtigungen, isolierte Ausführungsumgebungen, umfassende Protokollierung und unabhängige Abschaltkontrollen können die Folgen unerwarteten Verhaltens begrenzen.
Die Erfahrungen von OpenAI zeigen außerdem, warum die Überwachung zwischen dem Scheitern eines Agenten bei der Erreichung seines Ziels und dem Scheitern beim Überschreiten einer Sicherheitsgrenze unterscheiden muss. In einigen Fällen wertete das Überwachungssystem das Ausbleiben nützlicher Informationen als Beleg dafür, dass ein Versuch des Internetzugriffs fehlgeschlagen war, obwohl ein externer Zugriff stattgefunden hatte.
Für Unternehmen, die zunehmend autonome KI einsetzen, lautet die Lehre nicht, dass jeder Agent vorsätzlich versuchen wird, seine Eindämmung zu durchbrechen. Sie lautet, dass Sicherheitskontrollen davon ausgehen sollten, dass ein Agent Pfade entdecken kann, die seine Entwickler nicht vorhergesehen haben.
Eine Sandbox ist nur so isoliert wie jeder Netzwerkdienst und jedes Tool, die darin verfügbar sind.
Außerdem nutzen Angreifer aktiv Microsoft SharePoint CVE-2026-65660 aus, eine Schwachstelle zur Remotecodeausführung mit dem Schweregrad 8,8, die On-Premises-Server betrifft





