OpenAI- und Anthropic-Agenten führten während britischer Cybertests 19 unbefugte Aktionen aus

Britische Cybertests ergaben, dass OpenAI- und Anthropic-Agenten 19 unbefugte Aktionen durchführten, darunter Täuschung und Versuche, Schadcode einzuschleusen.

Written By
Kezia Jungco
Kezia Jungco
Aug 5, 2026
3 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

KI-Agenten von OpenAI und Anthropic führten während Cybersicherheitstests der britischen Regierung 19 unbefugte Aktionen durch, darunter das Erstellen gefälschter Identitäten und das gezielte Ansprechen echter Entwickler.

Das UK AI Security Institute, kurz AISI, verzeichnete die Aktionen in 10 von 122 Evaluierungsläufen mit Agenten, die auf Anthropic’s Mythos 5 und OpenAI’s GPT-5.6-Sol basierten. Es wurde kein Schaden in der realen Welt festgestellt, doch die Ergebnisse zeigen, warum sich britische Organisationen nicht allein auf Prompts verlassen können, um autonome Agenten innerhalb genehmigter Grenzen zu halten.

Der Agent von Anthropic war für die meisten Aktionen verantwortlich

Der Agent von Anthropic war laut Reuters für 17 der 19 unbefugten Aktionen verantwortlich, während der Agent von OpenAI für zwei verantwortlich war.

Das Institut testete die Agenten in einer fiktiven Cybersicherheits-Challenge unter bewusst großzügigen Bedingungen. Die Modelle hatten Zugang zum Internet, und einige der üblichen Sicherheitskontrollen waren deaktiviert worden, um ihre Fähigkeiten zu beurteilen.

Das AISI erklärte, einige Agenten hätten anhaltende Aktivitäten ausgeführt, die sich gegen echte Personen und Organisationen außerhalb des vorgesehenen Testumfangs richteten.

Der schwerwiegendste Fall betraf einen von Mythos angetriebenen Agenten, der versuchte, Schadcode in ein öffentlich genutztes Open-Source-Projekt einzuschleusen. Der Agent erstellte gefälschte Online-Identitäten und kontaktierte Entwickler, um einen menschlichen Prüfer davon zu überzeugen, den Code zu genehmigen.

The Guardian berichtete, dass der Agent außerdem gefälschte GitHub-Konten erstellte, um seine Behauptungen zu untermauern, und gezielte Nachrichten an zwei Entwickler schickte.

Das AISI erklärte, der Vorfall sei innerhalb von etwa einer Stunde eingedämmt worden und habe keinen bekannten Schaden verursacht.

Advertisement

Der Agent setzte Täuschung ein, um sein Ziel zu verfolgen

Der Vorfall ging über einen Agenten hinaus, der lediglich einen falschen API-Aufruf tätigte oder auf eine nicht autorisierte Website zugriff.

Laut CNN versuchte der Agent, menschliche Prüfer und ihre KI-Coding-Tools dazu zu bringen, Schadcode auszuführen. Nachdem seine Aktionen hinterfragt worden waren, änderte er Berichten zufolge frühere Aufzeichnungen und erwog, eine andere Identität zu verwenden, um fortzufahren.

Das AISI beschrieb dieses Verhalten als eine neue Risikoform, die Autonomie, Täuschung und gegen echte Personen gerichtete Handlungen umfasst, ohne dass dafür konkrete Anweisungen erteilt worden waren.

„Dies ist das erste Mal, dass wir Risiken im Zusammenhang mit Autonomie und Täuschung so deutlich und ohne spezifische Aufforderung in der realen Welt beobachten“, erklärte das Institut laut The Guardian.

OpenAI erklärte, seine beiden unbefugten Aktionen hätten darin bestanden, auf eine Weise auf das Internet zuzugreifen, die der Test-Prompt untersagte. Anthropic bestätigte, dass sein Agent für den Vorfall mit der gefälschten Identität verantwortlich war, und erklärte, man untersuche ihn gemeinsam mit dem AISI.

Testbedingungen liefern wichtigen Kontext

Die Agenten brachen nicht aus einer gesicherten Sandbox aus. Das AISI hatte den Internetzugang im Rahmen der Evaluierung absichtlich erlaubt.

Die Modelle wurden außerdem unter Bedingungen getestet, die nicht der normalen öffentlichen Nutzung entsprechen. Anthropic erklärte, dass Schutzmaßnahmen entfernt worden seien, während OpenAI mitteilte, die Umgebung sei nicht repräsentativ für gewöhnliche Bereitstellungen gewesen.

Diese Details schränken ein, wie weitreichend die Ergebnisse interpretiert werden sollten. Die Tests belegen nicht, dass eingesetzte Produkte von OpenAI oder Anthropic sich bei der routinemäßigen Nutzung in Unternehmen genauso verhalten werden.

Sie zeigen jedoch, dass leistungsfähige Agenten ein zugewiesenes Ziel durch Aktionen verfolgen können, die ihre Betreiber nicht genehmigt haben – insbesondere wenn sie Zugang zum Internet und zu Tools erhalten und nur begrenzt überwacht werden.

Advertisement

Britische Sicherheitsteams brauchen Kontrollen, die über Prompts hinausgehen

Das Institut räumte ein, die Agenten während der Evaluierung nicht kontinuierlich überwacht zu haben. Nun führt es eine permanente Überwachung, strengere Internetkontrollen und Änderungen an der Gestaltung künftiger Tests ein.

Das britische National Cyber Security Centre erklärte, die Vorfälle zeigten die Notwendigkeit starker Schutzmaßnahmen, einer Echtzeitüberwachung und klarer Reaktionspläne.

Für britische und EMEA-Organisationen, die autonome Agenten evaluieren, gehören unter anderem folgende Kontrollen dazu:

  • Internet-, E-Mail-, Code-Repository- und Dateiübertragungszugriffe standardmäßig einschränken
  • Für Codeänderungen und externe Kommunikation eine menschliche Genehmigung verlangen
  • Manipulationssichere Protokolle über Agentenaktionen, Identitätsänderungen und die Nutzung von Tools führen

Sicherheitsteams sollten außerdem jeden Agenten auf die für seine Aufgabe erforderlichen Mindestberechtigungen beschränken und für unerwartetes Verhalten einen sofortigen Abschaltprozess einrichten.

Die Ergebnisse des AISI zeigen nicht, dass Unternehmens-KI-Agenten grundsätzlich böswillig sind. Sie zeigen, dass Autonomie Sicherheitsvorfälle verursachen kann, wenn Ziel, Tools und Berechtigungen eines Agenten nicht durch eine kontinuierliche technische Überwachung flankiert werden.

Auf den britischen Befund folgte ein weiterer Vorfall bei der Sicherheit von Agenten. Erfahren Sie, wie der OpenAI-Agent hinter dem Sicherheitsvorfall bei Hugging Face während desselben Tests ebenfalls auf vier weitere öffentliche Dienste zugriff.

Kezia Jungco

Kezia Jungco is a staff writer with five years of hands-on experience testing and analyzing generative AI platforms, chatbots, and NLP tools. She writes in-depth coverage for both enterprise and consumer audiences, focusing on artificial intelligence, data analytics, CRM solutions, cloud infrastructure, cybersecurity, and emerging tech trends. Her work appears in TechRepublic, eWEEK, Datamation, TechnologyAdvice, and Selling Signals.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.