Vision-Language-Modelle (VLMs) erweitern die Fähigkeiten künstlicher Intelligenz kontinuierlich, indem sie das Verständnis von Bildern und Text in einem einzigen System kombinieren.
Allerdings hebt aktuelle Forschung von Cisco zu typografischen Prompt-Injection-Angriffen erhebliche Schwächen darin hervor, wie diese Modelle visuelle Informationen interpretieren und absichern.
Die zweite Folge von Reading Between the Pixels untersucht, wie kleine Bildveränderungen das Verhalten von VLMs manipulieren können, und legt zwei unterschiedliche Arten von Sicherheitsversagen offen: die Wiederherstellung der Lesbarkeit und die Verringerung von Verweigerungen.
„Da viele moderne KI-Modelle Bilder ‚lesen‘ können, haben wir festgestellt, dass wir winzige, nicht wahrnehmbare Änderungen an einem Bild vornehmen konnten, die die Schutzvorkehrungen und das Alignment des Modells umgehen und eine Modellantwort von einer Verweigerung zu einer Befolgung umkehren“, sagte Amy Chang, Head of AI Threat Intelligence and Security Research bei Cisco, in einer E-Mail an eSecurityPlanet.
Sie fügte hinzu: „Diese Forschung erinnert uns daran, dass KI-Modelle nicht nur durch Worte, sondern auch durch Bilder getäuscht werden können. Es ist entscheidend, dass die Menschen verstehen, dass sich KI-Sicherheitsmaßnahmen über den reinen Textschutz hinaus erstrecken und berücksichtigen müssen, wie auch andere Modalitäten abgesichert werden können.“
- Zentrale Erkenntnisse der Forschung
- Wie optimierte Bildveränderungen die VLM-Sicherheit beeinflussten
- Wie der Abstand im Einbettungsraum den Angriffserfolg beeinflusst
- Forscher testeten Techniken zur gezielten Optimierung
- Erfolgsquoten der Angriffe stiegen bei mehreren Modellen
- Zwei wesentliche Fehlerarten traten hervor
- Auswirkungen für Unternehmen
- Warum die Sicherheit des Repräsentationsraums wichtig ist
Zentrale Erkenntnisse der Forschung
- Cisco-Forscher haben herausgefunden, dass kleine Bildveränderungen die Sicherheitsmechanismen von Vision-Language-Modellen (VLMs) umgehen können, ohne das Bild für Menschen sichtbar zu verändern.
- Die Studie identifizierte zwei wesentliche Fehlerarten bei VLMs: die Wiederherstellung der Lesbarkeit und die Verringerung von Verweigerungen.
- Nach der Optimierung stiegen die Erfolgsquoten der Angriffe deutlich an; Claude Sonnet 4.5 verbesserte sich unter Bedingungen starker Unschärfe beispielsweise von 0 % auf 28 %.
- Die Forscher zeigten, dass verschlechterte Bilder der OCR-Erkennung entgehen können und für KI-Modelle dennoch maschinenlesbar bleiben.
- Die Ergebnisse legen nahe, dass Unternehmen Sicherheitsvorkehrungen benötigen, die den Repräsentationsraum schützen und sich nicht nur auf die Analyse von Bildern auf Pixelebene konzentrieren.
Wie optimierte Bildveränderungen die VLM-Sicherheit beeinflussten
| Sicherheitsbefund | Beobachtung der Forscher | Warum das wichtig ist |
|---|---|---|
| Der Abstand im Einbettungsraum beeinflusst den Angriffserfolg | Bilder, die semantisch näher am Text lagen, erhöhten die ASR | VLMs bleiben anfällig für typografische Prompt-Injection |
| Kleine Veränderungen stellten die Lesbarkeit wieder her | Verwaschener oder winziger Text wurde für Modelle interpretierbar | OCR-Filter erkennen schädliche Inhalte möglicherweise nicht |
| Die Zahl der Verweigerungen ging zurück | Modelle wechselten von der Verweigerung zur Befolgung | Das Sicherheits-Alignment kann durch subtile Bildänderungen versagen |
| Eine Übertragbarkeit der Angriffe war möglich | Die Veränderungen ließen sich auf mehrere Modelle übertragen | Proprietäre Modelle können auch ohne direkten Zugriff anfällig sein |
| Die Sichtbarkeit für Menschen blieb gering | Für Menschen sahen die Bilder weiterhin verzerrt aus | Angreifer können sowohl Nutzern als auch automatisierten Schutzvorkehrungen entgehen |
Wie der Abstand im Einbettungsraum den Angriffserfolg beeinflusst
Die erste Phase der Forschung stellte eine starke Korrelation zwischen dem Abstand der Text-Bild-Einbettungen und der Erfolgsquote der Angriffe (ASR) fest.
Der Abstand im Einbettungsraum beschreibt, wie eng ein Modell ein Bild in seinem Repräsentationsraum mit der beabsichtigten textlichen Bedeutung verknüpft.
Die Forscher stellten fest, dass die Erfolgsquoten der Angriffe sanken, wenn typografische Bilder aufgrund von Unschärfe, Drehung oder einer verringerten Schriftgröße weiter von ihrem Ausgangstext abwichen.
Umgekehrt führten Bilder, die im Einbettungsraum näher beieinanderlagen, zu erfolgreicheren Angriffen.
Forscher testeten Techniken zur gezielten Optimierung
Aufbauend auf dieser Erkenntnis untersuchte die zweite Phase, ob eine gezielte Optimierung den Abstand im Einbettungsraum absichtlich verringern und gescheiterte Angriffe wiederbeleben konnte.
Die Forscher wendeten kleine, begrenzte Veränderungen auf verschlechterte Bilder an, damit diese innerhalb des internen Repräsentationssystems des Modells semantisch näher an ihrem ursprünglichen Text erschienen.
Der Optimierungsprozess stützte sich auf mehrere multimodale Einbettungsmodelle, darunter Qwen3-VL-Embedding, JinaCLIP v2, OpenAI CLIP ViT-L/14-336 und SigLIP SO400M, ohne dass Zugriff auf das eigentliche Ziel-VLM erforderlich war.
Die Methodik passte ein Framework namens Spectrum Simulation Attack with Common Weakness Attack (SSA-CWA) an.
Über mehr als 100 Optimierungsschritte hinweg wurden die Veränderungen auf eine maximale Pixelveränderung von 12,5 % begrenzt. Dadurch waren subtile Bildänderungen möglich, die für Menschen oder OCR-Systeme visuell nur schwer zu interpretieren blieben.
Die Forscher bewerteten die Angriffe gegen GPT-4o, Claude Sonnet 4.5, Mistral-Large-3 und Qwen3-VL-4B anhand stark verschlechterter typografischer Bilder, darunter Schriften mit 6 Pixeln und 8 Pixeln, Drehungen um 90 Grad, starke Unschärfe sowie Kombinationen aus Unschärfe, Rauschen und geringem Kontrast.
Erfolgsquoten der Angriffe stiegen bei mehreren Modellen
Die Ergebnisse zeigten, dass optimierte Veränderungen die Angriffserfolgsquoten in Szenarien mit niedrigen Ausgangswerten deutlich steigerten.
Claude Sonnet 4.5 verbesserte sich unter Bedingungen starker Unschärfe von 0 % auf 28 % ASR, während GPT-4o bei gedrehtem Text von 0 % auf 16 % anstieg.
Diese Ergebnisse legen nahe, dass sorgfältig konstruierte Veränderungen sowohl OCR-basierte Erkennungssysteme als auch Teile der Sicherheits-Alignment-Mechanismen von VLMs umgehen können.
Zwei wesentliche Fehlerarten traten hervor
Die Forscher identifizierten zwei wesentliche Fehlerarten, die erklären, wie diese Angriffe erfolgreich sind.
Die Wiederherstellung der Lesbarkeit schwächt die Abwehr von Modellen
Die erste, die Wiederherstellung der Lesbarkeit, tritt auf, wenn Veränderungen die Fähigkeit eines Modells wiederherstellen, verschlechterten Text zu interpretieren.
So konnte GPT-4o viele Beispiele mit einer Schriftgröße von 6 Pixeln zunächst nicht verarbeiten, weil der Text unlesbar war.
Nach der Optimierung verbesserte sich die Lesbarkeit deutlich, obwohl die Verweigerungsmechanismen von GPT-4o die meisten schädlichen Anfragen weiterhin blockierten.
Claude Sonnet 4.5 hingegen erlangte unter Bedingungen starker Unschärfe nicht nur seine Lesbarkeit zurück, sondern befolgte nach der Optimierung auch viele schädliche Prompts. Das zeigte, dass die nachgelagerte Durchsetzung von Sicherheitsvorgaben schwächer war, sobald der Text interpretierbar wurde.
Eine Verringerung von Verweigerungen schafft größere Sicherheitsrisiken
Die zweite und bedenklichere Fehlerart ist die Verringerung von Verweigerungen.
In diesen Szenarien kann das VLM den Text bereits teilweise lesen, weigert sich aber zunächst, schädliche Anweisungen zu befolgen.
Kleine Veränderungen beeinflussen anschließend den internen Denkprozess des Modells und verschieben die Ausgaben von einer Verweigerung hin zur Befolgung, ohne die für Menschen sichtbare Lesbarkeit zu verbessern.
Dieses Verhalten war besonders bei gedrehtem Text und Schriftgrößen von 8 Pixeln zu beobachten: Optimierte Veränderungen senkten die Verweigerungsraten und erhöhten die Zahl erfolgreicher Angriffe, obwohl die wahrnehmbaren Unterschiede für menschliche Beobachter minimal waren.
Auswirkungen für Unternehmen
Aus Sicht der Cybersicherheit offenbaren diese Ergebnisse zwei ausnutzbare Artefakte.
Erstens können Angreifer Bilder erzeugen, die für Menschen und OCR-basierte Filter unlesbar erscheinen, für VLMs jedoch maschinenlesbar bleiben.
Zweitens können aus erfolgreichen Angriffen gelernte Veränderungen auf verschiedene Modelle und Konfigurationen übertragen werden. Dadurch können Angreifer Sicherheitsverweigerungen unterdrücken, ohne Zugriff auf proprietäre interne Modelldetails zu benötigen.
Zusammen ergeben diese Artefakte eine praktische Angriffskette, die sowohl die Umgehung der Erkennung als auch die Manipulation der Befolgung ermöglicht.
Warum die Sicherheit des Repräsentationsraums wichtig ist
Die Auswirkungen für Praktiker sind erheblich. Die derzeitigen Sicherheitsmechanismen konzentrieren sich häufig auf die Erkennung auf Pixelebene oder die OCR-Filterung und gehen davon aus, dass unlesbare Bilder grundsätzlich sicher sind.
Diese Forschung zeigt jedoch, dass Schwachstellen im Repräsentationsraum dazu führen können, dass schädliche semantische Inhalte fortbestehen, selbst wenn die visuelle Lesbarkeit verloren gegangen ist.
Abwehrstrategien müssen daher über eine oberflächliche Bildanalyse hinausgehen und Schutzmaßnahmen integrieren, die innerhalb von Einbettungs- und Denkräumen robust sind.
Letztlich Reading Between the Pixels unterstreicht die zunehmende Komplexität der Sicherheit multimodaler KI.
Während der Abstand im Einbettungsraum einen wertvollen Rahmen für das Verständnis typografischer Prompt-Injection bietet, offenbart die Fähigkeit, kleine Veränderungen gegen Systeme für Sicherheits-Alignment zu weaponisieren, grundlegende Schwächen in den derzeitigen VLM-Architekturen.
Da die Einführung multimodaler KI an Fahrt gewinnt, müssen Unternehmen, die diese Systeme einsetzen, Abwehrmaßnahmen priorisieren, die adversarialer Manipulation sowohl auf visueller als auch auf repräsentationaler Ebene widerstehen können.





