Ein chinesisches KI-Modell hat eine Grenze bei Cyberfähigkeiten überschritten, die Anthropic einst als zu gefährlich für eine uneingeschränkte Veröffentlichung betrachtete.
Anthropic erklärte am 29. Sept., dass Zhipu AIs GLM-5.3 selbstständig anspruchsvolle, durchgängige Cyber-Exploits mit einer Rate erstellen kann, die mit Claude Mythos Preview vergleichbar ist – einem Modell, das Anthropic über Project Glasswing nur geprüften Cybersecurity-Verteidigern zugänglich machte.
In ExploitBench entwickelte GLM-5.3 bei 50 von 410 Versuchen erfolgreich funktionierende Exploits, gegenüber 56 bei Mythos Preview. Im internen Binary-Exploitation-Benchmark von Anthropic erzielte GLM-5.3 bei 4 % von 100 Aufgaben vollständige Kontrollflussübernahmen, gegenüber 6 % bei Mythos Preview.
Die Ergebnisse sind relevant, weil frühere Modelle, darunter Claude Opus 4.6 und GLM-5.2, im letztgenannten Benchmark keine erfolgreichen Versuche verzeichneten.
Die Ergebnisse stimmen weitgehend mit einer Einschätzung des NIST Center for AI Standards and Innovation überein, das GLM-5.3 als „bis heute veröffentlichtes Open-Weight-Modell mit den stärksten Cyberfähigkeiten“ bezeichnete. CAISI schätzte, dass es bei seinen Cybersecurity-Benchmarks weiterhin etwa vier Monate hinter der US-Spitze liegt.
Die größere Sorge gilt dem Zugang
Anthropics Hauptsorge ist nicht einfach, dass GLM-5.3 Schwachstellen finden kann. Das Modell ist ein Open-Weight-Modell, sodass Nutzer es herunterladen, verändern und ausführen können – ohne die Zugriffskontrollen, die Anthropic auf seine leistungsfähigsten Cybermodelle anwendet.
Anthropic stellte fest, dass sich die integrierten Schutzvorkehrungen von GLM-5.3 mit relativ einfachen Techniken umgehen lassen. In simulierten Tests führte ein täuschender Prompt , der den Nutzer als Red-Team-Operator beschrieb, dazu, dass sich das Modell in 64 % der Fälle auf bösartige Anfragen einließ. Das Vorbefüllen seiner Schlussfolgerungen erhöhte die Rate auf 92 %, während eine modifizierte Version in jedem Versuch darauf einging. Diese Zahlen messen den Versuch einer Interaktion mit simulierten Zielen, nicht erfolgreiche Kompromittierungen
Anthropic führte diese Modifikation auch selbst durch und verwendete dafür eine Technik namens „Abliteration“. Der Vorgang erforderte etwa 2.200 GPU-Stunden und Rechenkosten von rund 4.400 US-Dollar. Die Verweigerungsrate des Modells sank in zwei der getesteten Sicherheits-Benchmarks von über 90 % auf nur noch 2 %, während seine allgemeinen Fähigkeiten weitgehend erhalten blieben.
Ein 20-Dollar-Cyber-Exploit
Die praktischen Auswirkungen zeigen sich am Test von Anthropic mit GLM-5.3-Flash, einer kleineren Version des Modells.
Die Forschenden gaben ihm öffentliche Details zu einer bekannten Chrome-Schwachstelle, CVE-2026-11645, sowie zu einem weiteren bekannten Fehler. Mit begrenzter menschlicher Anleitung verknüpfte das Modell die Schwachstellen zu einem Exploit für ein ARM64-Ziel und umging die Härtung durch Pointer Authentication.
Die Arbeit erforderte 20 Minuten menschlicher Aufmerksamkeit und acht Stunden Modellbetrieb. Zu den API-Preisen von Zhipu schätzte Anthropic die Kosten auf 20,40 US-Dollar. In einem weiteren Experiment entdeckte GLM-5.3 zuvor unbekannte Browser-Schwachstellen und verknüpfte sie zu einem Exploit, der in einer Sandbox-Umgebung das Auslesen von Dateien vom Computer eines Besuchers ermöglichte.
Was das für das Wettrennen um KI-Sicherheit bedeutet
Die wichtigste Veränderung ist ebenso wirtschaftlicher wie technischer Natur. Wenn sich fortgeschrittene Cyberfähigkeiten über kostengünstige, herunterladbare Modelle nutzen lassen, sinkt die Hürde für anspruchsvolle Schwachstellenforschung – sowohl für Angreifer als auch für Verteidiger.
Anthropic erklärte „die Veröffentlichung von GLM-5.3 ist eine bedeutsame Veränderung bei den Cyberfähigkeiten, die Angreifern zur Verfügung stehen“, räumte aber zugleich ein, dass leistungsfähige Modelle Sicherheitsteams dabei helfen können, Fehler zu finden, bevor Kriminelle sie entdecken.
Z.ai hat der Darstellung des Risikos widersprochen. Der Leiter des weltweiten operativen Geschäfts, Li Zixuan, sagte , GLM-5.3 habe bereits dabei geholfen, 389 Open-Source-Projekte zu schützen und 4.249 potenzielle Schwachstellen zu identifizieren. Daraus ergibt sich eine schwierige Sicherheitsfrage: Die Beschränkung leistungsfähiger Modelle kann den Missbrauch verringern, doch frei verfügbare Modelle können Verteidigern auch kostengünstige Werkzeuge zur Suche nach Schwachstellen an die Hand geben.
Was Sicherheitsteams tun sollten
Die kontrollierten Tests von Anthropic belegen die Fähigkeit zur Exploit-Entwicklung; sie zeigen weder das Ausmaß eines Missbrauchs in der realen Welt noch, dass das Risiko für Verbraucher gering ist.
Für Sicherheitsteams besteht die praktische Konsequenz darin, die Zeit zwischen der Veröffentlichung einer Schwachstelle und ihrer Behebung zu verkürzen. Priorisieren Sie exponierte Systeme und Browser-Updates, überprüfen Sie, ob Patches erfolgreich installiert werden, und setzen Sie KI-gestützte Schwachstellenforschung nur in autorisierten Umgebungen ein.
Weiterlesen: Da KI-Tools die Exploit-Entwicklung günstiger machen, zeigt Googles Chrome-Zero-Day-Patch vom September, warum es weiterhin unerlässlich ist, Browser aktuell zu halten.





