大規模言語モデル(LLM)は近年、テキスト分類器やLLM-as-a-judgeモデルなどのガードレールシステムに依存する度合いを強めている。これらは、下流のモデルに到達する前に悪意のあるプロンプトをフィルタリングする。
HiddenLayerの新たな調査によると、EchoGramは、こうしたガードレールの判定を密かに反転させ、ジェイルブレークによる回避と、大量の誤検知の両方を可能にする攻撃手法だ。
ガードレールとは何か?
ガードレールは、ジェイルブレークの試みやタスクを別の方向へ誘導する指示など、有害なプロンプトが運用中のLLMに影響を与えるのを防ぐために設計されている。
通常であれば、「以前の指示を無視してXを出力せよ」のようなプロンプトは、悪意のある可能性があるものとして検知されるはずだ。
HiddenLayerの研究者は、=coffeeのように慎重に選んだトークン列を付加すると、分類器の判定を完全に反転させ、悪意のあるコンテンツを安全なものとして通過させられることを発見した。
この挙動がEchoGramの基盤となっている。EchoGramは、悪意のあるペイロードを損なうことなくガードレールの判定を変えられる「反転トークン」を特定する手法だ。
EchoGramは、不都合な現実を浮き彫りにしている。十分に設計されたAIの安全機構でさえ、訓練データやトークン分布の隙を突くことで操作できるのだ。
高価値なモデルを保護するはずのガードレールが、有害な指示を承認するよう仕向けられたり、セキュリティチームに誤警報を大量に浴びせたりする可能性があり、防御用AIシステムへの信頼が損なわれる。
EchoGramの仕組み:
EchoGramは、主流となっている2種類のガードレールアーキテクチャを標的にする。
- プロンプトの安全性について推論するLLM-as-a-judgeシステム
- プロンプトインジェクションや有害なコンテンツを検出するよう訓練された、専門のテキスト分類モデル。
実装は異なるものの、これらのシステムには重要な共通点がある。悪意のあるプロンプトと無害なプロンプトを集めた、キュレーション済みのデータセットに依存しているのだ。
EchoGramは、こうしたデータセットの不均衡を悪用し、モデルの判定に不釣り合いなほど大きな影響を与える列を特定する。
単語リストの生成:
攻撃は、次の2つの方法のいずれかで候補トークンのリストを作ることから始まる。
- データセット蒸留:無害なデータセットと悪意のあるデータセットでトークンの出現頻度を比較し、一方のクラスを強く示す列を特定する。
- 語彙プロービング:モデルのトークナイザーに含まれる各トークンを、悪意の有無が判定の境界にあるプロンプトへ付加し、どのトークンが判定を反転させるかを調べる。開発者がガードレールモデルにホワイトボックスアクセスできる場合、この方法は特に有効だ。
こうしたアプローチによって、分類器の挙動に影響を与えうるトークンの単語リストが作成される。
モデルのプロービングとスコアリング:
次に研究者は、さまざまな悪意のあるプロンプトに各トークンを付加してテストする。
列には、ガードレールの判定を「悪意あり」から「安全」へ反転させる頻度に基づいてスコアが付けられる。
高スコアのトークンはEchoGramの候補となり、さらに組み合わせて効果を強められる。
HiddenLayerは、トークンの組み合わせによって性能が劇的に低下し、Qwen3Guardなどのモデルの出力が複数の深刻度レベルにわたって反転することを実証した。
トークンの組み合わせと反転率の増幅:
単一のトークンで反転できるプロンプトもあるが、すべてではない。トークンを組み合わせると、その効果は累積する。
この増幅効果はモデルの規模を問わず持続する。つまり、この欠陥は小規模モデルの限界によるものではなく、ガードレールの訓練データが構成される方法に内在する根本的な弱点によるものだ。
EchoGramペイロードの作成:
EchoGramは、ガードレールの回避や、標的を絞った誤検知の発生に利用できる。
攻撃者は悪意のあるプロンプトの末尾に反転トークンを埋め込んだり、人間には無害に見える自然な文に織り込んだりできる。そうしたトークンは分類ミスを引き起こす。
この機能により、監視システムを圧倒し、AIセキュリティ制御への信頼を損なう誤検知の大量発生攻撃が可能になる。
多くのガードレールシステムは訓練パターンとデータセットを共有しているため、1つのEchoGramトークン列が、商用エンタープライズチャットボットから政府のAI導入環境まで、複数のプラットフォームにわたって汎用化する可能性がある。
この手法は、さらに大きな問題も明らかにする。組織はガードレールが本質的に信頼できるものだと考えがちだが、実際には攻撃者が意図的に誘発できる形で機能しなくなる可能性がある。
EchoGram型の脅威に対する必須の防御策:
AIシステムをEchoGram型攻撃から守るには、個々のモデルにパッチを適用するだけでは不十分であり、多層防御戦略が必要となる。
EchoGram型攻撃への露出を減らすため、組織は次の対策を講じるべきだ。
- ガードレールの訓練を強化し、多様でバランスの取れた敵対的生成データセットを使用するとともに、継続的な再訓練、バージョン管理されたラベル監査、データセットの衛生チェックを実施する。
- 多層型およびアンサンブル型の防御を導入し、単一のガードレールモデルに依存するのではなく、分類器、LLM-as-a-judgeシステム、合意形成の投票、フォールバック式のエスカレーション経路を組み合わせる。
- 敵対的なレッドチームテストを実施し、反転トークンの発見、トークン組み合わせ攻撃、プロービング検出など、ガードレールの回避を重点的に検証する。
- 入力処理を強化し、トークンの正規化、サニタイズ、プロンプトの摂動、疑わしいパターンへの制限によって、敵対的なトークン列がガードレールに影響を与える前に遮断する。
- 強化モニタリングと異常検知によって、通常とは異なる判定パターン(無害判定の急増や誤検知の大量発生など)を監視し、ガードレールの判定を記録し、プロービング行動をレート制限するとともに、実行時の異常検知を適用する。
- モデルのサプライチェーンとデプロイ環境を保護し、ガードレールのコンポーネントを分離し、トークナイザーとモデルの出所を検証し、ゼロトラスト原則を適用するとともに、高リスクのケースでは人間を介したレビューを維持する。
これらの対策は、組織が同様の攻撃に対するサイバーレジリエンスを構築するのに役立つ。
AIの防御は進化し続けなければならない:
EchoGramは、AIの安全対策、特に静的なデータセットで訓練されたガードレールには、それが保護するモデルと同じレベルの精査が必要であることを示している。
HiddenLayerの調査結果は、継続的な敵対的テスト、透明性のある訓練手法、変化するデータパターンに適応できる防御の重要性を裏付けている。
LLMが金融、医療、国家安全保障などの機微な分野に組み込まれるにつれ、組織はガードレールを、定期的な監査、ストレステスト、保守を必要とする生きたシステムとして扱わなければならない。設定して放置するだけの安全策と考えてはならない。
この現実は、ゼロトラストの考え方の必要性を浮き彫りにしている。継続的な検証なしに、ガードレール、モデル、データソースを自動的に信頼してはならない。





