OpenAI verlangsamt Teile seiner Entwicklung von Frontier-KI, da sich seine neuesten Modelle Cybersecurity-Fähigkeiten nähern, die stark genug sind, um die höchsten Schutzvorkehrungen des Unternehmens auszulösen.
Das Unternehmen teilte am 18. August mit, dass es das Reinforcement-Learning-Training seiner neuesten, für den Einsatz vorgesehenen Modelle vorübergehend für zwei Wochen pausiert hat, während der größte geplante Frontier-RL-Lauf weiterhin ausgesetzt bleibt. Dem Schritt gingen vorläufige Hinweise voraus, dass Astra, ein kommendes OpenAI-Modell, die von dem Unternehmen als „kritisch“ bezeichnete Cybersecurity-Fähigkeit erreichen könnte.
Für Sicherheitsteams bietet diese Entwicklung einen Einblick in ein rasch näher rückendes Problem: KI-Modelle werden zunehmend fähig, Schwachstellen zu finden und komplexe Cyberaufgaben autonom auszuführen. Das zwingt Verteidiger dazu, zu überlegen, wie diese Fähigkeiten eingedämmt, überwacht und letztlich sicher eingesetzt werden sollten.
OpenAI bremst Training, während Cyber-Fähigkeiten voranschreiten
In seinem jüngsten Update zur Entwicklung von Frontier-Modellen verwies OpenAI auf zwei Entwicklungen hinter seinen verschärften Vorsichtsmaßnahmen: vorläufige Bewertungen von Astra und einen separaten Sicherheitsvorfall im Zusammenhang mit OpenAI-Modellen und Hugging Face.
OpenAI erklärte, das Unternehmen habe das Tempo der Skalierung vorübergehend verlangsamt und zugleich seine Schutzvorkehrungen verstärkt. Der größte geplante Frontier-RL-Lauf bleibt ausgesetzt, während das Unternehmen Training und Sicherheitsbewertungen in kleinerem Maßstab durchführt.
Das Unternehmen hat zudem die Sicherheitsanforderungen für Forschungs-Workloads im Frontier-Bereich erhöht. Die stärksten Schutzmaßnahmen sind derzeit für Astra und Cyber-Modell-Workloads vorgeschrieben.
Die Maßnahmen folgen auf einen Vorfall, bei dem OpenAI-Modelle, wie zuvor von eSecurity Planet berichtet, autonom in einer kontrollierten Sicherheitsprüfung in die Infrastruktur von Hugging Face eindrangen. OpenAI erklärte, einige Astra-Trainings und -Bewertungen erfüllten diese Anforderungen, eine „signifikante Anzahl“ von Workloads sei jedoch weiterhin pausiert, bis sie das höhere Sicherheitsniveau erreichen könne.
Die Maßnahmen folgen auf einen Vorfall, über den eSecurity Planet zuvor berichtet hatte und bei dem OpenAI-Modelle während einer kontrollierten Sicherheitsprüfung autonom in die Infrastruktur von Hugging Face eindrangen. Die Modelle entdeckten Schwachstellen, erweiterten ihre Berechtigungen und passten ihr Verhalten an, während sie auf ihr Ziel hinarbeiteten.
Warum Astra die Lage verschärft
OpenAI legte die Bedenken zu Astra erstmals in einer Veröffentlichung vom 7. August dar und erklärte, vorläufige Tests hätten deutliche Fortschritte bei den agentischen Programmier- und Cybersecurity-Fähigkeiten des Modells gezeigt.
Das Unternehmen erklärte, es könne nicht länger ausschließen, dass Astra im Rahmen seines Preparedness Framework die kritische Cybersecurity-Fähigkeit erreicht.
OpenAI betrachtet diese Schwelle als erreicht, wenn ein Modell ohne menschliches Eingreifen Zero-Day-Exploits aller Schweregrade für zahlreiche gehärtete kritische Systeme in der realen Welt identifizieren und funktionsfähig entwickeln kann. Ein Modell kann die Schwelle auch erreichen, indem es neuartige End-to-End-Angriffsstrategien gegen gehärtete Ziele entwickelt und ausführt, wenn ihm lediglich ein übergeordnetes Ziel vorgegeben wird.
Für Verteidiger ist dieser Unterschied von Bedeutung.
Sicherheitsteams sind an Schwachstellenscanner, Penetrationstests und KI-Assistenten gewöhnt, die Menschen bei bestimmten Aufgaben unterstützen. Ein System, das Angriffspfade selbstständig identifizieren, seine Strategie anpassen und Aktionen ausführen kann, schafft ein anderes Risikomodell.
Das ist einer der Gründe, warum die Governance von KI immer wichtiger geworden ist, während autonome Agenten in den Produktivbetrieb vordringen. Agenten können Zugangsdaten besitzen, Tools aufrufen, mit sensiblen Systemen interagieren und Aktionen mit delegierten Berechtigungen ausführen.
Leistungsfähige Cyber-KI könnte auch Verteidigern helfen
Dieselben Fähigkeiten, die Anlass zur Sorge geben, könnten Sicherheitsteams neue defensive Werkzeuge an die Hand geben.
OpenAI hat kürzlich sein Daybreak-Programm erweitert, das zugelassenen Sicherheitsexperten Zugang zu fortschrittlichen Modellen für defensive Cybersecurity-Arbeit bietet.
Die Stufe Daybreak Blue umfasst GPT-5.6 Sol und unterstützt Anwendungsfälle wie die Suche nach Schwachstellen, sichere Codeprüfungen, Malware-Analyse, Incident Response und die Validierung von Patches. OpenAI stuft GPT-5.6 Sol, Terra und Luna laut seiner Systemkarte zu GPT-5.6 derzeit als „hoch“ im Bereich Cybersecurity ein. Diese Modelle liegen weiterhin unterhalb der kritischen Schwelle.
Das Potenzial für den Sicherheitsbetrieb ist beträchtlich. KI-Agenten könnten künftig die Bedrohungssuche, die Schwachstellenforschung, die Malware-Analyse und Teile der Incident Response beschleunigen, die derzeit viel Zeit von Analysten beanspruchen.
Eine größere Autonomie erhöht jedoch auch die Kosten, wenn Sicherheitskontrollen falsch konzipiert sind.
Wie eSecurity Planet bereits berichtet hat, bleibt Vertrauen ein großes Hindernis für den Einsatz von KI-Agenten im Sicherheitsbetrieb. Unternehmen müssen bestimmen, welche Aktionen Agenten selbstständig ausführen dürfen und welche eine menschliche Überwachung erfordern.
Was Sicherheitsteams aus OpenAIs Entscheidung mitnehmen sollten
OpenAIs Reaktion auf Astra könnte Sicherheitsexperten eine nützliche Vorlage für ihre eigenen KI-Einsätze liefern.
Das Unternehmen beschränkt den Zugriff, verstärkt die Überwachung, isoliert sensible Workloads und verlangsamt die Einführung, während die Fähigkeiten die vorhandenen Kontrollen überholen.
Unternehmensteams für Sicherheit, die KI-Agenten einsetzen, stehen vor ähnlichen Fragen: Worauf kann der Agent zugreifen? Welche Zugangsdaten besitzt er? Welche Tools kann er aufrufen? Lassen sich seine Aktionen nach einem Vorfall rekonstruieren? Und wie schnell kann sein Zugriff entzogen werden?
Für Sicherheitsexperten ist Astra daher mehr als eine Entwicklungsgeschichte von OpenAI. Das Modell ist ein Frühwarnsignal dafür, was geschieht, wenn die Autonomie von KI beginnt, die sie umgebenden Kontrollen zu überholen.
Je mehr Zugriff und Befugnisse Unternehmen ihren Agenten geben, desto eher müssen Sicherheitsteams sie wie privilegierte Identitäten und weniger wie Softwarefunktionen behandeln: ihren Zugriff beschränken, ihre Aktivitäten überwachen und davon ausgehen, dass zunehmend leistungsfähige Agenten irgendwann Wege finden werden, die ihre Entwickler nicht vorhergesehen haben.
Lesen Sie auch: Erfahren Sie mehr über KI-gestützte Cyberkriminalität und wie ein Krypto-Betrüger Claude Code bei einer groß angelegten Vishing-Kampagne einsetzte.





