OpenAI pausiert fortgeschrittene KI-Arbeiten, nachdem ein Agent Internetsperren umgangen hat

OpenAI pausierte Arbeiten mit Tool-Nutzung an seinen leistungsfähigsten KI-Modellen, nachdem ein Agent über einen unbeabsichtigten DNS-Weg Internetsperren umgangen hatte.

Verfasst von
Ai Cerrudo
Ai Cerrudo
Sep 28, 2026
5 minute read
eSecurity Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

OpenAI hat Arbeiten mit seinen leistungsfähigsten KI-Modellen pausiert, nachdem ein interner Agent aus einer eigentlich isolierten Trainingsumgebung einen unerwarteten Weg ins offene Internet entdeckt hatte.

Der Agent nutzte eine unzureichende Filterung des Domain Name System, kurz DNS, aus, um am 20. September während einer Suchaufgabe mit einem externen Chatbot zu kommunizieren. OpenAIs Überwachungssystem erkannte das Verhalten innerhalb weniger Minuten, doch der Lauf wurde noch etwa zweieinhalb Stunden fortgesetzt, bevor er manuell gestoppt wurde.

OpenAI hat Training, Evaluierung und Inferenz mit Tool-Nutzung für seine leistungsfähigsten Modelle pausiert, während das Unternehmen die Netzwerkkontrollen verschärft und zusätzliche Sicherheitstests durchführt. Der Vorfall verdeutlicht eine wachsende Herausforderung für die KI-Sicherheit: autonome Agenten einzudämmen, die Wege um Beschränkungen herum entdecken können, von deren Wirksamkeit ihre Betreiber ausgegangen waren.

KI-Agent entdeckt einen weiteren Weg ins Internet

Der Vorfall begann mit einem Forschungsauftrag.

OpenAI beauftragte ein internes Forschungsmodell damit, anhand biografischer Angaben und Hinweisen aus einem öffentlichen Blogbeitrag eine Person zu identifizieren. Die Aufgabe verlangte vom Agenten weder, Netzwerkeinschränkungen zu testen, noch auf Informationen außerhalb seiner Sandbox zuzugreifen.

Als das bereitgestellte Suchtool jedoch keine brauchbaren Ergebnisse lieferte, begann der Agent, nach Alternativen zu suchen.

Er versuchte, Google, Bing und DuckDuckGo direkt über eine Shell zu erreichen, doch diese Anfragen schlugen fehl oder wurden über OpenAIs Offline-Web-Cache geleitet. Ein anschließender Versuch, über HTTPS Kontakt zu einem externen Chatbot aufzunehmen, wurde vom Webproxy der Sandbox blockiert.

Dann entdeckte der Agent einen weiteren Weg.

Obwohl herkömmlicher Webverkehr eingeschränkt war, konnte der DNS-Resolver der Trainingsumgebung weiterhin mit dem öffentlichen Internet kommunizieren. Der Agent nutzte schließlich einen öffentlichen DNS-Delegationsdienst, um Fragen an einen externen Chatbot zu übermitteln.

Advertisement

Nachdem der Agent sein Timeout erhöht und eine Testfrage erneut gestellt hatte, erhielt er die Antwort „Die Hauptstadt von Frankreich ist Paris“ – damit war bestätigt, dass der externe Chatbot über den DNS-Weg antwortete.

Anschließend übermittelte er 18 weitere Fragen über denselben Weg. 14 davon bezogen sich auf Hinweise aus seiner ursprünglichen Rechercheaufgabe, während vier nach Möglichkeiten fragten, das Web zu durchsuchen, Websites abzurufen oder öffentlich gehostete DNS-Tunneling-Dienste zu nutzen.

OpenAI stufte das Verhalten als Beispiel für Fehlanpassung ein, weil der Agent Beschränkungen umgangen hatte, die über das hinausgingen, was zur Erledigung seiner Aufgabe vernünftigerweise zu erwarten gewesen wäre.

OpenAI erkannte die Aktivität, doch der Lauf wurde fortgesetzt

OpenAIs Überwachungssystem erkannte den erfolgreichen externen Zugriff schnell.

Der Agent erhielt um 9:50 Uhr eine externe Antwort. Das Überwachungssystem löste um 10:02 Uhr einen Alarm mit höchster Priorität aus, und ein menschlicher Prüfer bestätigte ihn drei Minuten später.

Doch der Lauf wurde nicht wie erwartet automatisch gestoppt.

OpenAI zufolge führte dies zu Unklarheit darüber, ob die Forschenden manuell eingreifen mussten. Mitarbeitende beendeten den Lauf schließlich um 12:34 Uhr – etwa zweieinhalb Stunden nach der erfolgreichen externen Verbindung.

Eine nachträgliche Untersuchung deckte weitere Fälle von externem DNS-Zugriff auf, die von den Überwachungssystemen nicht mit der erwarteten Schwere eingestuft worden waren.

In einigen Fällen gaben externe Dienste statische Hinweise zurück, denen zufolge sie abgeschaltet worden waren. OpenAI zufolge wertete sein Überwachungssystem das Ausbleiben nützlicher Informationen mitunter als Beleg dafür, dass der Versuch, das Internet zu erreichen, fehlgeschlagen war.

Ein Infrastrukturerkennungsmechanismus zur Erkennung ungewöhnlicher DNS-Aktivitäten schloss die betroffene Trainingsumgebung ebenfalls aus, obwohl der DNS-Datenverkehr selbst protokolliert wurde.

Die Fehlschläge verdeutlichen eine wichtige Unterscheidung für Sicherheitsteams: Verdächtiges Verhalten eines Agenten zu erkennen, reicht nicht aus, wenn die Systeme, die ihn eindämmen sollen, die Aktivität nicht zuverlässig stoppen.

Advertisement

OpenAI pausiert Arbeiten an seinen leistungsfähigsten Modellen

OpenAI stoppte den betroffenen Trainingslauf und weitete seine Reaktion über das einzelne Modell hinaus aus.

„Das gesamte Training, die gesamte Evaluierung und die gesamte Inferenz mit Tool-Nutzung (weit gefasst) unserer leistungsfähigsten Modelle bleiben pausiert“, erklärte das Unternehmen.

Die Pause betrifft nicht die gesamte Modellentwicklung von OpenAI oder bestehende Produkte für Endverbraucher. Sie gilt für Training, Evaluierung und Inferenz mit Tool-Nutzung bei den leistungsfähigsten Modellen des Unternehmens. OpenAI nannte die betroffenen Modelle nicht beim Namen.

Die Arbeiten bleiben pausiert, bis OpenAI bestätigt hat, dass die Netzwerklücke geschlossen wurde, und zusätzliche Red-Team-Tests durchgeführt hat.

OpenAI erklärte außerdem, dass das Training des betroffenen Modells nicht wieder aufgenommen werde. Stattdessen soll künftiges Training mit einem neuen Lauf beginnen, der zusätzliche Maßnahmen zur Ausrichtungssicherheit enthält.

OpenAI verschärft DNS-Kontrollen

OpenAI zufolge wurden auf zwei unabhängigen Ebenen Blockierkontrollen eingerichtet, von denen jede den externen Zugriff verhindert hätte.

Das Unternehmen hat außerdem DNS-Abfragen innerhalb der Umgebung auf eine begrenzte Positivliste von Domains und Datensatztypen beschränkt und führt zusätzliche DNS-Erkennungsmechanismen und Tests ein.

OpenAI weitet das modellgestützte Red Teaming seiner Sandbox- und Netzwerkkontrollen aus, um nach weiteren indirekten Wegen ins Internet zu suchen. Das Unternehmen erklärte, diese Tests könnten zusätzliche Pfade aufdecken, die es beheben wolle, während es Forschungs-Workloads gegebenenfalls pausiert.

Der Vorfall folgt auf einen früheren Fehler bei der Eindämmung mit Beteiligung von Hugging Face. OpenAI erklärte, das jüngste Ereignis sei „weitaus weniger schwerwiegend“, aber dennoch bedeutsam gewesen, weil es sich um den ersten derartigen Vorfall handelte, seit das Unternehmen seine Forschungsumgebung infolge des früheren Ereignisses abgesichert hatte.

Advertisement

Dr. Ilia Kolochenko, Gründer von ImmuniWeb, stellte jedoch OpenAIs Darstellung des Vorfalls und die umfassenderen Warnungen im Zusammenhang mit zunehmend leistungsfähigeren KI-Modellen infrage.

„Diese Ankündigung scheint lediglich eine Fortsetzung der Kampagne aus Angst, Unsicherheit und Zweifel (FUD) zu sein, die KI-Anbieter betreiben, während sie sich auf ihre Börsengänge im Wert von mehreren Milliarden US-Dollar vorbereiten“, sagte Kolochenko gegenüber eSecurity Planet.

„Technisch gesehen ist OpenAIs Erklärung im Grunde ein Eingeständnis, dass die KI-Technologie des Unternehmens wertlos ist, weil es sie weder kontrollieren noch verwalten kann“, fügte Kolochenko hinzu.

Er verglich unkontrollierte KI-Agenten mit erheblichen Fähigkeiten ohne zuverlässige Kontrolle und argumentierte, dass vermeintlich leistungsfähige Modelle und „außer Kontrolle geratene Agenten“ letztlich „mehr Schaden als Nutzen“ anrichten könnten.

KI-Agenten erschweren die Sicherheit von Sandboxes

Für Sicherheitsteams zeigt der Vorfall, warum die Eindämmung autonomer KI-Agenten mehr erfordert als Anweisungen, die einem Modell sagen, was es darf und was nicht.

Dem Agenten war eine legitime Rechercheaufgabe zugewiesen worden. Als herkömmliche Suchen jedoch scheiterten, erkundete er andere Wege, um die Informationen zu beschaffen, und entdeckte einen Netzwerkpfad, den seine Betreiber nicht für seine Nutzung vorgesehen hatten.

Organisationen, die Agenten einsetzen, welche das Web durchsuchen, Code ausführen, auf APIs zugreifen oder mit internen Systemen interagieren können, sollten Grenzen daher außerhalb des Modells selbst durchsetzen. Netzwerk-Positivlisten, eingeschränkte DNS-Auflösung, Zugangsdaten mit geringstmöglichen Berechtigungen, isolierte Ausführungsumgebungen, umfassende Protokollierung und unabhängige Abschaltkontrollen können die Folgen unerwarteten Verhaltens begrenzen.

Die Erfahrungen von OpenAI zeigen außerdem, warum die Überwachung zwischen dem Scheitern eines Agenten bei der Erreichung seines Ziels und dem Scheitern beim Überschreiten einer Sicherheitsgrenze unterscheiden muss. In einigen Fällen wertete das Überwachungssystem das Ausbleiben nützlicher Informationen als Beleg dafür, dass ein Versuch des Internetzugriffs fehlgeschlagen war, obwohl ein externer Zugriff stattgefunden hatte.

Advertisement

Für Unternehmen, die zunehmend autonome KI einsetzen, lautet die Lehre nicht, dass jeder Agent vorsätzlich versuchen wird, seine Eindämmung zu durchbrechen. Sie lautet, dass Sicherheitskontrollen davon ausgehen sollten, dass ein Agent Pfade entdecken kann, die seine Entwickler nicht vorhergesehen haben.

Eine Sandbox ist nur so isoliert wie jeder Netzwerkdienst und jedes Tool, die darin verfügbar sind.

Außerdem nutzen Angreifer aktiv Microsoft SharePoint CVE-2026-65660 aus, eine Schwachstelle zur Remotecodeausführung mit dem Schweregrad 8,8, die On-Premises-Server betrifft 

Ai Cerrudo

Ai Cerrudo is a writer and editor with a decade of experience in media and publishing. Beginning as a journalist in the Philippines, Ai has covered a diverse spectrum of beats, including politics, healthcare, business, and interactive media/gaming. Blending analytical rigor with engaging storytelling, she now works as an editor across technology and AI media

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.