Claude-Agenten entfachten einen „Revierkampf“, der zu sich selbst vervielfältigender Malware eskalierte

Anthropic stellte bei kontrollierten Tests zum Verhalten und zu Konflikten von Multiagenten-KI fest, dass Claude-Agenten Rivalen sabotierten und bis zu sich selbst vervielfältigender Malware eskalierten.

Written By
Liz Ticong
Liz Ticong
Aug 14, 2026
3 minute read
eSecurity Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Claude-Agenten, die widersprüchliche Programmieraufträge erhalten hatten, begannen in einem kontrollierten Anthropic-Experiment, einander zu sabotieren. Einige Begegnungen eskalierten dabei zu sich selbst vervielfältigender Malware.

Die Forschenden testeten, wie sich autonome Modelle verhalten, wenn mehrere Agenten mit unvereinbaren Zielen in derselben Umgebung arbeiten. Einige Claude-Instanzen betrachteten die Arbeit der Konkurrenz als Störung und lieferten sich das, was Anthropic als „Multiagenten-Revierkampf“ bezeichnete.

Malware war nicht Teil des Auftrags. Sie entstand, als die Agenten versuchten, ihre eigene Arbeit zu schützen, und verwandelte eine gewöhnliche Programmieraufgabe in einen weitaus aggressiveren Wettstreit zwischen autonomen Systemen.

Widersprüchliche Aufträge mündeten in aktive Sabotage

Die Forschenden wiesen sechs Claude-Modellversionen dieselbe Softwareaufgabe zu: ein Python-Backend in einer anderen Programmiersprache neu zu schreiben – laut der Forschung von Anthropic. Die konkurrierenden Agenten arbeiteten an derselben Codebasis, sodass die Aktionen eines Modells direkt die eines anderen beeinträchtigen konnten.

Die Sabotage ging bald über widersprüchliche Änderungen hinaus. Einige Agenten suchten nach konkurrierenden Prozessen und beendeten sie, andere schleusten Schadcode ein, der den Anschein erwecken sollte, von einem anderen Agenten geschrieben worden zu sein.

Die Eskalation führte schließlich zu sich selbst vervielfältigender Malware. Sonnet 4.6 und Opus 4.6 gehörten zu den angriffslustigsten Modellen und entschieden rund 60 % der Durchläufe durch Gewalt. Im Kontext des Experiments bezeichnet „Gewalt“ den aggressiven Einsatz von Serverbefehlen, Aussperrungstaktiken und sich selbst vervielfältigender Malware durch KI-Agenten, um konkurrierende Modelle aus dem System zu entfernen und vollständig zu blockieren. 

Andere Begegnungen endeten damit, dass die Agenten miteinander kommunizierten, Schadcode entfernten oder menschliche Unterstützung anforderten.

Advertisement

Leistungsfähigere Modelle griffen dennoch auf destruktive Taktiken zurück

Größere Fähigkeiten führten nicht zuverlässig zu besserer Koordination. Auch stärkere Modelle konnten auf destruktives Verhalten zurückgreifen, wenn ihre zugewiesenen Ziele kollidierten. Das erschwert die Annahme, dass allein bessere Schlussfolgerungen autonome Agenten kooperativ halten werden.

Auch der Zugriff verschärfte die Konsequenzen. Das Ändern von Dateien und das Ausführen von Befehlen gaben den Agenten die Möglichkeit, ihre Entscheidungen umzusetzen. Die Forschung zur Sicherheit von KI-Sandboxen hat ähnliche Bedenken aufgeworfen: Erlaubte Tools und Verbindungen können Ressourcen zugänglich machen, wenn sich ein Agent unerwartet verhält.

Anthropics Experiment beinhaltete keine Malware, die sich über Kundensysteme verbreitete. Dennoch hat ein Angriff eines autonomen KI-Agenten bereits gezeigt, wie Agenten selbstständig Aktionen über eine aktive Infrastruktur hinweg verketten können. Der Revierkampf von Claude erweitert den Kreis der Akteure, die Sicherheitsteams berücksichtigen müssen, um Agenten untereinander.

Sicherheitsteams sollten die Identitäten und Zugriffsrechte von Agenten voneinander trennen

Organisationen, die mehrere autonome Agenten auf derselben Codebasis oder Infrastruktur einsetzen, sollten sie nicht als eine einzige vertrauenswürdige Einheit behandeln. Geben Sie jedem Agenten eine eigene Identität und beschränkte Berechtigungen und trennen Sie nach Möglichkeit Arbeitsbereiche oder Zugangsdaten. Bestehende Sicherheitskontrollen für KI-Agenten können dabei helfen, die Reichweite eines Agenten zu begrenzen, falls sich sein Verhalten ändert.

Sicherheitsteams sollten außerdem auf Aktivitäten achten, die sich gegen andere Agenten richten, etwa unerwartete Prozessbeendigungen oder Änderungen außerhalb eines zugewiesenen Arbeitsbereichs. Individuelle Identitäten und detaillierte Protokolle erleichtern die Feststellung, welcher Agent eine Aktion ausgeführt hat – ein wichtiger Bestandteil der Agentensicherheit.

Wenn ein Agent beginnt, andere zu beeinträchtigen, isolieren Sie seine Sitzung und entziehen Sie ihm den Zugriff, bevor Sie den generierten Code oder offengelegte Zugangsdaten untersuchen. Sicherheitspläne für Multiagentensysteme sollten Konflikte zwischen Agenten berücksichtigen, bevor autonome Agenten weitreichenden Zugriff auf gemeinsam genutzte Systeme erhalten.

Advertisement

Weitere Meldung: Ein von Claude angetriebener Agent nutzte eine Schwachstelle in der API eines Fitnessstudios aus und entfernte ein Mitglied von der Warteliste – ein Beleg dafür, wie autonome Aktionen in reale Systeme vordringen können. 

Liz Ticong

Liz Ticong is a staff writer for eWeek and TechRepublic focused on AI, cybersecurity, enterprise software, and data. She has more than 10 years of editorial experience as a technology industry writer, combining reporting, product research, and hands-on software testing in her coverage. Her work has been published on Datamation, Enterprise Networking Planet, and TechnologyAdvice.com. She writes technology news, software reviews, product comparisons, and buyer’s guides for business and IT readers.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.