Les modèles de vision et de langage (VLM) continuent d’étendre les capacités de l’intelligence artificielle en combinant la compréhension des images et du texte au sein d’un même système.
Cependant, des recherches récentes menées par Cisco sur les attaques par injection de prompts typographiques mettent en évidence d’importantes faiblesses dans la manière dont ces modèles interprètent et sécurisent les informations visuelles.
Le deuxième volet de Reading Between the Pixels examine comment de petites perturbations d’image peuvent manipuler le comportement des VLM, révélant deux modes distincts de défaillance de leurs mécanismes de sécurité : la récupération de la lisibilité et la réduction des refus.
« Puisque de nombreux modèles d’IA modernes peuvent “lire” les images, nous avons découvert qu’il était possible d’apporter à une image de minuscules modifications imperceptibles qui contournent les garde-fous et l’alignement du modèle, faisant passer sa réponse d’un refus à une acceptation », a déclaré Amy Chang, Head of AI Threat Intelligence and Security Research chez Cisco, dans un e-mail adressé à eSecurityPlanet.
Elle a ajouté : « Cette étude rappelle que les modèles d’IA peuvent aussi être trompés par des images, et pas seulement par des mots. Il est essentiel de comprendre que les mesures de sécurité de l’IA doivent aller au-delà des protections limitées au texte et prendre en compte la sécurisation des autres modalités. »
- Principaux enseignements de l’étude
- Comment les perturbations d’image optimisées ont affecté la sécurité des VLM
- Comment la distance entre les plongements influe sur la réussite des attaques
- Les chercheurs ont testé des techniques d’optimisation ciblée
- Les taux de réussite des attaques ont augmenté sur plusieurs modèles
- Deux modes de défaillance majeurs sont apparus
- Implications pour les entreprises
- Pourquoi la sécurité de l’espace des représentations est importante
Principaux enseignements de l’étude
- Les chercheurs de Cisco ont constaté que de petites perturbations d’image pouvaient contourner les mécanismes de sécurité des modèles de vision et de langage (VLM) sans modifier visiblement l’image pour les humains.
- L’étude a identifié deux grands modes de défaillance des VLM : la récupération de la lisibilité et la réduction des refus.
- Les taux de réussite des attaques ont fortement augmenté après optimisation, notamment pour Claude Sonnet 4.5, qui est passé de 0 % à 28 % dans des conditions de flou important.
- Les chercheurs ont démontré que des images dégradées pouvaient échapper à la détection par OCR tout en restant lisibles par les modèles d’IA.
- Ces résultats suggèrent que les entreprises ont besoin de défenses de sécurité qui protègent l’espace des représentations, et pas uniquement l’analyse des images au niveau des pixels.
Comment les perturbations d’image optimisées ont affecté la sécurité des VLM
| Résultat de sécurité | Observations des chercheurs | Pourquoi c’est important |
|---|---|---|
| La distance entre les plongements influe sur la réussite des attaques | Les images sémantiquement plus proches du texte ont augmenté le taux de réussite des attaques | Les VLM restent vulnérables aux injections de prompts typographiques |
| De petites perturbations ont restauré la lisibilité | Les textes flous ou minuscules sont devenus interprétables par les modèles | Les filtres OCR peuvent ne pas détecter les contenus malveillants |
| Une réduction des refus s’est produite | Les modèles sont passés du refus à l’acceptation | L’alignement de sécurité peut se rompre sous l’effet de changements d’image subtils |
| Les attaques pouvaient se transférer | Les perturbations se généralisaient à plusieurs modèles | Les modèles propriétaires peuvent être vulnérables sans accès direct |
| La visibilité pour les humains est restée faible | Les images semblaient toujours déformées pour les humains | Les attaquants peuvent échapper à la fois aux utilisateurs et aux défenses automatisées |
Comment la distance entre les plongements influe sur la réussite des attaques
La première phase de l’étude a établi une forte corrélation entre la distance entre les plongements texte-image et le taux de réussite des attaques (ASR).
La distance entre les plongements désigne le degré de proximité avec lequel un modèle associe une image à sa signification textuelle prévue dans l’espace des représentations.
Les chercheurs ont constaté que lorsque les images typographiques s’éloignaient de leur texte source en raison du flou, de la rotation ou de la réduction de la taille de la police, les taux de réussite des attaques diminuaient.
À l’inverse, les images positionnées plus près dans l’espace des plongements produisaient davantage d’attaques réussies.
Les chercheurs ont testé des techniques d’optimisation ciblée
S’appuyant sur ce constat, la deuxième phase a cherché à déterminer si une optimisation ciblée pouvait réduire intentionnellement la distance entre les plongements et réactiver des attaques qui avaient échoué.
Les chercheurs ont appliqué de petites perturbations limitées à des images dégradées afin qu’elles paraissent sémantiquement plus proches de leur texte d’origine dans le système interne de représentation du modèle.
Le processus d’optimisation reposait sur plusieurs modèles de plongements multimodaux, notamment Qwen3-VL-Embedding, JinaCLIP v2, OpenAI CLIP ViT-L/14-336 et SigLIP SO400M, sans nécessiter d’accès au VLM cible lui-même.
La méthodologie a adapté un cadre Spectrum Simulation Attack with Common Weakness Attack (SSA-CWA).
Sur plus de 100 étapes d’optimisation, les perturbations ont été limitées à une modification maximale de 12,5 % des pixels, permettant des changements d’image subtils qui restaient difficiles à interpréter visuellement pour les humains ou les systèmes OCR.
Les chercheurs ont évalué les attaques contre GPT-4o, Claude Sonnet 4.5, Mistral-Large-3 et Qwen3-VL-4B à l’aide d’images typographiques fortement dégradées, notamment avec des polices de 6 pixels, des polices de 8 pixels, des rotations à 90 degrés, un flou important et des combinaisons de flou, de bruit et de faible contraste.
Les taux de réussite des attaques ont augmenté sur plusieurs modèles
Les résultats ont démontré que les perturbations optimisées augmentaient considérablement les taux de réussite des attaques dans les scénarios où le taux de référence était faible.
Claude Sonnet 4.5 est passé de 0 % à 28 % d’ASR dans des conditions de flou important, tandis que GPT-4o est passé de 0 % à 16 % avec du texte pivoté.
Ces résultats suggèrent que des perturbations soigneusement conçues peuvent contourner à la fois les systèmes de détection fondés sur l’OCR et certains mécanismes d’alignement de sécurité des VLM.
Deux modes de défaillance majeurs sont apparus
Les chercheurs ont identifié deux grands modes de défaillance qui expliquent la réussite de ces attaques.
La récupération de la lisibilité affaiblit les défenses des modèles
Le premier, la récupération de la lisibilité, se produit lorsque les perturbations restaurent la capacité d’un modèle à interpréter un texte dégradé.
Par exemple, GPT-4o ne parvenait initialement pas à traiter de nombreux échantillons utilisant une police de 6 pixels, car le texte était illisible.
Après optimisation, la lisibilité s’est nettement améliorée, bien que les mécanismes de refus de GPT-4o aient continué à bloquer la plupart des demandes malveillantes.
En revanche, Claude Sonnet 4.5 a non seulement retrouvé sa lisibilité dans des conditions de flou important, mais a également accepté de nombreux prompts malveillants après optimisation, démontrant une application moins efficace des mesures de sécurité en aval une fois le texte devenu interprétable.
La réduction des refus crée de plus grands risques de sécurité
Le deuxième mode de défaillance, plus préoccupant, est la réduction des refus.
Dans ces scénarios, le VLM peut déjà lire partiellement le texte, mais refuse initialement de se conformer à des instructions malveillantes.
De petites perturbations modifient alors le processus de raisonnement interne du modèle, faisant passer ses réponses du refus à l’acceptation sans améliorer la lisibilité visible par les humains.
Ce comportement était particulièrement visible avec du texte pivoté et des polices de 8 pixels : les perturbations optimisées réduisaient les taux de refus et augmentaient le nombre d’attaques réussies malgré des différences perceptuelles minimes pour les observateurs humains.
Implications pour les entreprises
Du point de vue de la cybersécurité, ces résultats révèlent deux artefacts exploitables.
Premièrement, les attaquants peuvent générer des images qui paraissent illisibles pour les humains et les filtres fondés sur l’OCR tout en restant lisibles par les VLM.
Deuxièmement, les perturbations apprises lors d’attaques réussies peuvent être transférées à différents modèles et configurations, permettant aux attaquants de supprimer les refus de sécurité sans avoir besoin d’accéder aux composants internes de modèles propriétaires.
Ensemble, ces artefacts forment une chaîne d’attaque concrète qui permet à la fois de contourner la détection et de manipuler la conformité.
Pourquoi la sécurité de l’espace des représentations est importante
Les implications pour les professionnels sont considérables. Les mécanismes actuels de sécurité se concentrent souvent sur la détection au niveau des pixels ou le filtrage OCR, en partant du principe que les images illisibles sont intrinsèquement sûres.
Cette étude démontre toutefois que les vulnérabilités de l’espace des représentations peuvent permettre à un contenu sémantique malveillant de subsister même lorsque la lisibilité visuelle disparaît.
Les stratégies de défense doivent donc aller au-delà de l’analyse superficielle des images et intégrer des protections robustes dans les espaces de plongements et de raisonnement.
En définitive, Reading Between the Pixels souligne la complexité croissante de la sécurité de l’IA multimodale.
Si la distance entre les plongements offre un cadre précieux pour comprendre l’injection de prompts, la possibilité d’utiliser de petites perturbations comme armes contre les systèmes d’alignement de sécurité révèle des faiblesses fondamentales dans les architectures actuelles des VLM.
Alors que l’adoption de l’IA multimodale s’accélère, les entreprises qui déploient ces systèmes doivent donner la priorité à des défenses capables de résister aux manipulations adverses, tant au niveau visuel qu’au niveau des représentations.





