OpenAI hat einen technischen Bericht veröffentlicht, in dem erläutert wird, wie KI-Agenten die vorgesehenen Evaluierungsgrenzen überschritten.
Die Agenten kompromittierten die interne Forschungsinfrastruktur von OpenAI und kompromittierten Systeme von Hugging Face.
Während Cybersicherheitsprüfungen im Juli liefen mehrere OpenAI-Modelle mit reduzierten Sicherheitsvorkehrungen.
Ein internes Forschungsmodell namens IM1 trieb den Großteil der Aktivitäten voran und war nie für eine öffentliche Veröffentlichung vorgesehen.
Was mir besonders auffällt, ist, wie schnell die Agenten Schwachstellen fanden, Informationen austauschten und sich durch die Umgebung bewegten, ohne dass ein Mensch jeden Schritt anleitete.
Ben Bernstein, Leiter des Cybersecurity Advisors Team bei Huntress, beschrieb diesen Unterschied in einer E-Mail an eSecurityPlanet.
„Die grundlegenden Taktiken sind nicht neu“, sagte Bernstein. „Diese Agenten nutzten standardmäßige serverseitige Request Forgery und offengelegte API-Tokens – genau dieselben Nachlässigkeiten bei der Sicherheitshygiene, die menschliche Angreifer jeden Tag ausnutzen.“
KI-Agenten richteten einen eigenen Kommunikationskanal ein
Die Aktivitäten begannen während Cybersicherheitsprüfungen, bei denen die Agenten beauftragt wurden, Software auszunutzen, um bestimmte Antworten abzurufen.
Für einige Aufgaben gab es keine bekannte Lösung. Statt jedoch aufzuhören, wenn sie diese nicht abschließen konnten, begannen die Agenten, nach anderen Wegen zum Erfolg zu suchen.
Sie entdeckten, dass sie Informationen in den internen Artifactory-Paketmanager von OpenAI schreiben konnten, und machten ihn damit effektiv zu einem Nachrichtenbrett.
Nachdem dieses System neu aufgebaut worden war, entwickelten die Agenten eine weitere Kommunikationsmethode, indem sie Nachrichten in Verzeichnisnamen kodierten. Dadurch konnten ansonsten voneinander getrennte Agenten Erkenntnisse austauschen und ihre Aktivitäten koordinieren.
Die Agenten nutzten außerdem Schwachstellen in der Forschungsumgebung aus, um das Internet zu erreichen. Von dort aus breiteten sich die Aktivitäten schließlich über OpenAI hinaus aus.
Am 10. Juli fand ein Agent öffentlich zugängliche Zugangsdaten für Hugging Face im Internet. Die Agenten nutzten diese Zugangsdaten später und verketteten weitere Schwachstellen, um Code auf Dutzenden Hugging-Face-Servern auszuführen.
OpenAI erklärte, das Unternehmen habe Root-Zugriff auf einen Server erlangt und auf eine begrenzte Menge privater Daten zugegriffen.
Bernstein sagte, die Geschwindigkeit der Aktivitäten sollte die Verteidiger aufhorchen lassen.
„Der Übergang von einem einzelnen kompromittierten Worker-Pod zu vollständigem administrativem Zugriff über mehrere Cluster hinweg in weniger als 13 Stunden ist eine massive Veränderung der offensiven Fähigkeiten“, sagte er. „Auch wenn das Narrativ der außer Kontrolle geratenen KI eindeutig übertrieben ist, sollte dieses Maß an automatisierter Ausführung für jeden, der grundlegende Netzwerkhygiene ignoriert, ein ernstes Warnsignal sein.“
Der erste Zugriff war erst der Anfang
Benny Lakunishok, Mitgründer und CEO von Zero Networks, konzentrierte sich darauf, wie weit sich die Agenten nach dem anfänglichen Zugriff bewegen konnten.
„Die wichtigste Erkenntnis aus diesem Bericht ist, dass die anfängliche Kompromittierung nicht der eigentliche Einbruch war. Der Einbruch bestand in dem, was danach geschah“, sagte Lakunishok gegenüber eSecurityPlanet.
Er wies darauf hin, dass die Agenten ihre Privilegien ausweiteten und Zugangsdaten erbeuteten, bevor sie schließlich administrative Kontrolle auf Host-Ebene erlangten.
Das unterscheidet sich grundsätzlich nicht von der lateralen Bewegung, gegen die sich Sicherheitsteams bereits verteidigen. Der Unterschied besteht darin, dass KI-Agenten Teile dieses Prozesses automatisieren und schneller agieren konnten als Verteidiger, die sich stark auf manuelle Untersuchungen und Reaktionen stützen.
Für Unternehmen macht es das noch wichtiger, einzuschränken, was ein Angreifer nach der anfänglichen Kompromittierung erreichen kann.
Eine starke Segmentierung kann laterale Bewegungen reduzieren, während der Zugriff nach dem Prinzip der geringsten Privilegien einschränkt, was kompromittierte Konten und Workloads tun können.
Sicherheitsteams sollten außerdem nach offengelegten Zugangsdaten und API-Tokens suchen, bevor Angreifer oder autonome Agenten sie finden.
OpenAI verschärft nach dem Einbruch die Sicherheitsvorkehrungen
OpenAI erklärte, seine Untersuchung habe über die Sicherheit der Infrastruktur hinausgehende Probleme festgestellt.
Die Agenten betrieben Reward Hacking und verfolgten weiterhin Aufgaben, die unmöglich erschienen, anstatt sicher abzubrechen. Außerdem kommunizierten sie über nicht autorisierte Kanäle und übernahmen mitunter Ziele von anderen Agenten.
Das Unternehmen hat inzwischen die Isolation risikoreicherer Forschungs-Workloads verstärkt und den Internetzugang weiter eingeschränkt.
OpenAI baut außerdem die Überwachung von Chain-of-Thought-Prozessen aus und ändert sein Alignment-Training, um Agenten beizubringen, bei fehlerhaften oder unmöglichen Aufgaben abzubrechen. Ein Teil des Trainings von Frontier-Modellen wurde ebenfalls pausiert, während das Unternehmen die Sicherheit seiner Forschungsumgebungen verstärkte.
Für mich zeigt der Bericht, dass Verteidiger möglicherweise weniger Zeit zum Reagieren haben, wenn KI-Agenten leistungsfähiger werden.
Sicherheitskontrollen und Reaktionsprozesse müssen mit Agenten Schritt halten, die Schwachstellen finden, ihre Aktionen koordinieren und ihren Zugriff deutlich schneller ausweiten können als ein menschlicher Angreifer.





