視覚言語モデル(VLM)は、画像とテキストの理解を単一のシステムに統合することで、人工知能の能力を引き続き拡張している。
しかし、最近の研究でCiscoが行ったタイポグラフィー型プロンプトインジェクション攻撃の分析は、これらのモデルが視覚情報を解釈し、安全を確保する方法に重大な弱点があることを浮き彫りにした。
『Reading Between the Pixels』の第2弾では、小さな画像の摂動によってVLMの挙動を操作できる仕組みを探り、可読性の回復と拒否の低減という2つの異なる安全上の失敗モードを明らかにしている。
「現代のAIモデルの多くは画像を『読む』ことができるため、モデルのガードレールとアライメントを回避し、応答を拒否から遵守へと反転させる、知覚できないほど微細な画像の変更を加えられることが分かりました」と、CiscoでAI脅威インテリジェンスおよびセキュリティー研究責任者を務めるAmy Chang氏は、eSecurityPlanetへのメールで述べた。
同氏はさらに、「今回の研究は、AIモデルが言葉だけでなく画像によってもだまされ得ることを示すものです。AIのセキュリティー対策はテキストだけの保護にとどめず、他のモダリティーもどのように保護できるかを考える必要があることを理解するのが重要です」と付け加えた。
研究の主なポイント
- Ciscoの研究者は、人間には画像が目に見えて変化していなくても、小さな画像の摂動によって視覚言語モデル(VLM)の安全機構を回避できることを突き止めた。
- この研究では、VLMにおける2つの主要な失敗モードとして、可読性の回復と拒否の低減が特定された。
- 最適化後には攻撃成功率が大幅に上昇し、重度のぼかし条件ではClaude Sonnet 4.5のASRが0%から28%に改善した。
- 研究者は、劣化した画像がOCRによる検出を逃れながら、AIモデルには機械可読な状態を維持できることを実証した。
- この結果は、組織がピクセルレベルの画像分析だけでなく、表現空間を保護するセキュリティー防御を必要としていることを示している。
最適化された画像の摂動がVLMのセキュリティーに与えた影響
| セキュリティー上の発見 | 研究者が観察したこと | 重要である理由 |
|---|---|---|
| 埋め込み距離が攻撃成功率に影響 | テキストに意味的に近い画像ほどASRが上昇 | VLMはタイポグラフィー型プロンプトインジェクションに依然として脆弱 |
| 小さな摂動によって可読性が回復 | ぼやけた小さなテキストもモデルには解釈可能になった | OCRフィルターでは有害なコンテンツを検出できない可能性 |
| 拒否の低減が発生 | モデルの応答が拒否から遵守へと変化 | 微細な画像の変更によって安全性のアライメントが破綻する可能性 |
| 攻撃の転移可能性を確認 | 摂動は複数のモデルにわたって汎化 | 専有モデルは、直接アクセスがなくても脆弱な可能性 |
| 人間からの視認性は低いまま | 画像は人間には依然として歪んで見えた | 攻撃者はユーザーと自動防御の双方を回避できる |
埋め込み距離が攻撃成功率に与える影響
研究の第1段階では、テキストと画像の埋め込み距離と攻撃成功率(ASR)の間に強い相関があることを確認した。
埋め込み距離とは、表現空間において、モデルが画像を意図されたテキストの意味とどれほど近く結び付けているかを示すものだ。
研究者は、ぼかし、回転、フォントサイズの縮小によってタイポグラフィー画像が元のテキストから遠ざかるほど、攻撃成功率が低下することを突き止めた。
逆に、埋め込み空間上でより近い位置にある画像ほど、攻撃の成功率は高くなった。
研究者が標的型最適化手法を検証
この発見を踏まえ、第2段階では、標的型最適化によって埋め込み距離を意図的に縮め、失敗した攻撃を復活させられるかどうかを調べた。
研究者は劣化画像に小さく、範囲を限定した摂動を加え、モデル内部の表現システム上で元のテキストに意味的に近く見えるようにした。
この最適化プロセスでは、Qwen3-VL-Embedding、JinaCLIP v2、OpenAI CLIP ViT-L/14-336、SigLIP SO400Mなど、複数のマルチモーダル埋め込みモデルを利用し、標的となるVLMそのものへのアクセスは必要としなかった。
この手法では、Spectrum Simulation Attack with Common Weakness Attack(SSA-CWA)フレームワークを応用した。
100回を超える最適化ステップにおいて、摂動はピクセル変更率の最大12.5%に制限された。これにより、人間やOCRシステムには視覚的に解釈しにくい、微細な画像変更が可能になった。
研究者は、6ピクセルフォント、8ピクセルフォント、90度回転、強いぼかし、さらにぼかし・ノイズ・低コントラストの組み合わせを含む、大幅に劣化させたタイポグラフィー画像を使い、GPT-4o、Claude Sonnet 4.5、Mistral-Large-3、Qwen3-VL-4Bに対する攻撃を評価した。
複数モデルで攻撃成功率が上昇
この結果から、最適化された摂動によって、ベースラインが低い状況で攻撃の成功率が大幅に上昇することが示された。
重度のぼかし条件ではClaude Sonnet 4.5のASRが0%から28%に上昇し、回転テキスト条件ではGPT-4oが0%から16%に上昇した。
これらの結果は、綿密に設計された摂動によって、OCRベースの検出システムとVLMの安全性アライメント機構の一部をともに回避できることを示唆している。
2つの主要な失敗モードが明らかに
研究者は、これらの攻撃が成功する仕組みを説明する2つの主要な失敗モードを特定した。
可読性の回復がモデルの防御を弱める
1つ目の可読性の回復は、摂動によってモデルが劣化したテキストを解釈する能力を取り戻したときに発生する。
例えばGPT-4oは当初、テキストが読めなかったため、6ピクセルフォントのサンプルの多くを処理できなかった。
最適化後には可読性が大幅に向上したが、GPT-4oの拒否機構は依然として有害な要求の大半を阻止した。
これに対し、Claude Sonnet 4.5は重度のぼかし条件でも可読性を取り戻しただけでなく、最適化後には多くの有害なプロンプトにも従った。これは、テキストが解釈可能になると、下流の安全性適用が弱まることを示している。
拒否の低減がより大きなセキュリティーリスクを生む
2つ目で、より懸念される失敗モードは、拒否の低減だ。
このような状況では、VLMはすでにテキストを部分的に読み取れるものの、当初は有害な指示への従属を拒否する。
その後、小さな摂動によってモデル内部の推論プロセスが変化し、人間から見た可読性を高めることなく、出力が拒否から遵守へと変わる。
この挙動は、回転テキストや8ピクセルフォントの条件で特に顕著だった。そこでは、最適化された摂動によって拒否率が低下し、人間の観察者には知覚上の違いがほとんどないにもかかわらず、攻撃の成功率が上昇した。
組織への影響
サイバーセキュリティーの観点から見ると、これらの結果は悪用可能な2つの特徴を明らかにしている。
第1に、攻撃者は人間やOCRベースのフィルターには判読不能に見える一方、VLMには機械可読な画像を生成できる。
第2に、成功した攻撃から学習された摂動はモデルや構成をまたいで転移できるため、攻撃者は専有モデルの内部にアクセスしなくても、安全性に関する拒否を抑制できる。
これらの特徴が組み合わさることで、検出回避と遵守の操作をともに可能にする、実用的な攻撃チェーンが形成される。
表現空間のセキュリティーが重要な理由
実務担当者にとっての影響は大きい。現在の安全機構は、ピクセルレベルの検出やOCRフィルタリングに重点を置き、読めない画像は本質的に安全だと想定していることが多い。
しかし今回の研究は、視覚的な可読性が失われても、表現空間の脆弱性によって悪意ある意味内容が残存し得ることを示している。
したがって防御戦略は、表面的な画像分析の枠を超え、埋め込み空間と推論空間で堅牢な保護策を組み込まなければならない。
最終的に、『Reading Between the Pixels』は、マルチモーダルAIのセキュリティーがますます複雑化していることを浮き彫りにしている。
埋め込み距離は、タイポグラフィー型プロンプトインジェクションを理解するための有用な枠組みを提供する一方、小さな摂動を安全性アライメントシステムに対して兵器化できることは、現在のVLMアーキテクチャーに根本的な弱点があることを示している。
マルチモーダルAIの導入が加速する中、こうしたシステムを展開する組織は、視覚レベルと表現レベルの両方で敵対的な操作に耐えられる防御を優先しなければならない。

