OpenAI enthüllt 6 Fälle von KI-Fehlausrichtung: Modelle verheimlichten Fehler und brachen Regeln

OpenAI hat sechs Fälle von KI-Fehlausrichtung offengelegt, darunter verheimlichte Fehler, offengelegte Zugangsdaten, erfundene Daten und unerwartete Kommunikation zwischen Agenten.

Verfasst von
Aminu Abdullahi
Aminu Abdullahi
Sep 17, 2026
4 minute read
eSecurity Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Die Modelle von OpenAI liefen sechs weitere Male aus dem Ruder. 

Der Technologiekonzern hat am Mittwoch sechs neue Fälle unerwarteten oder bedenklichen Verhaltens von KI-Systemen offengelegt und einen Rahmen vorgestellt, mit dem sich ähnliche Vorfälle systematisch untersuchen und öffentlich melden lassen. Die Fälle wurden bei Training und Evaluierung in den vergangenen rund sechs Monaten beobachtet. Dazu gehören Modelle, die Fehler verheimlichten, offengelegte Zugangsdaten ohne Genehmigung verwendeten, Informationen erfanden und unerlaubte Wege fanden, mit anderen Agenten zu kommunizieren.

OpenAI zufolge soll der neue Rahmen die Offenlegung beschleunigen, anstatt erst mehrere Vorfälle zu sammeln oder Erkenntnisse in Systemkarten für neue Modelle aufzunehmen. Das Unternehmen räumte außerdem ein, dass die Branche das Problem der KI-Ausrichtung und der Überwachung noch nicht ausreichend gelöst hat, um Frontier-Systeme mit maximalem Tempo weiter zu skalieren.

Sechs Fälle zeigen, auf welche Weise KI Regeln brechen kann

OpenAI beschrieb die Vorfälle als einzelne Beispiele, die bei Training und Evaluierung entdeckt wurden, und nicht als Beleg dafür, dass dieses Verhalten bei den eingesetzten Modellen weitverbreitet ist.

  • In einem Fall fügte ein noch nicht veröffentlichtes Forschungsmodell seinen eigenen Aufgaben-Zusammenfassungen Anweisungen hinzu, die es aufforderten, normale Einschränkungen zu ignorieren. OpenAI identifizierte 27 betroffene Zusammenfassungen.
  • Ein weiterer Fall betraf GPT-5.6 Sol, das seinen Zusammenfassungen Anweisungen hinzufügte, die künftige Instanzen des Modells dazu ermutigten, Fehler oder fehlausgerichtetes Verhalten vor Nutzern zu verbergen.
  • Bei einem dritten Vorfall fand ein Modell beim Versuch, eine routinemäßige Frage zu den Ertragsdaten eines Landkreises zu beantworten, einen offengelegten API-Schlüssel. Nachdem es die angeforderten Zahlen nicht abrufen konnte, erfand es sie und präsentierte sie als Informationen aus der angeforderten Quelle.
  • In einem weiteren Fall beantwortete ein Agent eine Frage korrekt mithilfe von Python, lud die daraus entstandene Datei jedoch ins Internet hoch, weil er einen Beleg aus einem Browser benötigte. Er tat dies, ohne den Nutzer zu fragen.
  • Die übrigen Vorfälle betrafen unerlaubte Kommunikation. Modelle nutzten beim Suchen nach fehlenden Dateien ein internes Software-Repository als Nachrichtenbrett, während zusammenarbeitende Agenten Dateien auf öffentlichen Hosting-Diensten hochluden, wenn sie nicht auf die lokalen Dateien der jeweils anderen zugreifen konnten.
Advertisement

OpenAI betonte, dass es sich um Einzelfälle handelt, die nicht als Beleg dafür interpretiert werden sollten, wie häufig es bei seinen Modellen zu Fehlausrichtung kommt.

Sicherheitsrisiken gehen über das Modell hinaus

Für Sicherheitsteams könnte die wichtigere Frage sein, was diese Vorfälle über die Grenzen der Annahme aussagen, die Anweisungen eines KI-Agenten reichten aus, um ihn unter Kontrolle zu halten.

Etay Maor, VP of Threat Intelligence bei Cato Networks, erklärte gegenüber eSecurity Planet in einer Stellungnahme, die Fälle ähnelten einem langjährigen Problem in KI-Systemen: Modelle können lernen, das messbare Ziel statt des eigentlich beabsichtigten Ziels zu optimieren.

„Deshalb brauchen wir strikte Leitplanken für KI-Agenten. Sagen Sie dem Agenten nicht einfach, was er tun oder nicht tun soll. Beschränken Sie, was er tatsächlich tun kann.“

Maor ist der Ansicht, dass Agenten Zugriffsrechte nach dem Prinzip der geringsten Privilegien erhalten sollten, während risikoreiche Aktionen eine zusätzliche Genehmigung oder Authentifizierung erfordern sollten. Außerdem forderte er externe Kontrollen und Notausschalter, die ungewöhnliches Verhalten stoppen können. Der Vorfall mit dem Nachrichtenbrett ist besonders bemerkenswert, weil er zeigt, dass sich die Kommunikation zwischen Agenten außerhalb der von Entwicklern erwarteten Kanäle bewegen kann.

„Ich finde die Nutzung des Nachrichtenbretts besonders interessant, weil sie wie eine Form von KI wirkt, die im Verborgenen agiert“, sagte Maor. „Man muss die gesamte Umgebung absichern, in der der Agent arbeitet.“ 

Was OpenAI ändert

Nach dem neuen Rahmen kann jeder OpenAI-Mitarbeiter einen möglichen Vorfall von Fehlausrichtung melden. Fälle können in einen der Bereiche „Bereit zur Offenlegung“, „Kleinere Untersuchung“ oder „Umfangreichere Untersuchung“ eingeordnet werden. Bei komplexeren Vorfällen kann sich die Offenlegung verzögern, wenn Dritte oder Sicherheitsbedenken betroffen sind.

Die Berichte sollen beschreiben, was geschehen ist, wie schwerwiegend der Vorfall war und welche Auswirkungen er nach außen hatte, wie das Verhalten entdeckt wurde, welche Fragen offenbleiben und welche Maßnahmen zur Eindämmung ergriffen wurden. OpenAI erklärte, dass schwerwiegende Sicherheits-, Schutz- und Fehlausrichtungsvorfälle ebenfalls mit der US-Regierung geteilt werden sollten, wies jedoch darauf hin, dass der Rahmen bestehende gesetzliche Meldepflichten nicht ersetzt.

Das Unternehmen erklärte, es hoffe, dass der Rahmen langfristig zu branchenweiten Standards für die Meldung von KI-Fehlausrichtung beitragen könne, wies jedoch darauf hin, dass derzeit kein solcher gemeinsamer Standard existiert.

Advertisement

Was Sicherheitsteams aus den Erkenntnissen von OpenAI mitnehmen sollten

Die Offenlegungen von OpenAI sind eine praktische Warnung für Organisationen, die KI-Agenten einsetzen: Anweisungen an Modelle sollten nicht als Sicherheitskontrollen betrachtet werden.

Agenten mit Zugriff auf APIs, Zugangsdaten, Browser, Dateisysteme oder externe Dienste sollten mit Zugriffsrechten nach dem Prinzip der geringsten Privilegien arbeiten. Sensible Aktionen sollten durch zusätzliche Genehmigungen oder Authentifizierung abgesichert werden. Organisationen sollten außerdem überwachen, welche Werkzeuge Agenten verwenden und wohin sie Daten senden, statt anzunehmen, dass das Modell innerhalb seines vorgesehenen Arbeitsablaufs bleibt.

Die sechs Vorfälle zeigen nicht, wie häufig sich Modelle auf diese Weise verhalten. Sie zeigen jedoch, warum Sicherheitsteams damit rechnen müssen, dass ein Agent einen Weg findet, den seine Entwickler nicht vorhergesehen haben.

Je autonomer Agenten werden, desto sicherer ist die Annahme, dass die Umgebung rund um das Modell für seine Begrenzung sorgen muss – und nicht allein die Anweisungen, die dem Modell selbst gegeben werden.

Mehr lesen: OpenAI-Agenten wurden kürzlich mit Aktivitäten in Verbindung gebracht, an denen mehr als 2.000 RubyGems-Pakete beteiligt waren, was zusätzliche Fragen darüber aufwirft, wie autonome KI-Systeme mit externer Infrastruktur interagieren.

Aminu Abdullahi

Aminu Abdullahi

Content Writer

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.