Large Language Models (LLMs) verlassen sich zunehmend auf Guardrail-Systeme – etwa Textklassifikatoren und LLM-as-a-judge-Modelle –, um bösartige Prompts herauszufiltern, bevor sie nachgelagerte Modelle erreichen.
Neue Forschung von HiddenLayer zeigt EchoGram, eine Angriffstechnik, die diese Guardrail-Bewertungen unbemerkt umkehren kann und dadurch sowohl Jailbreaks als auch eine große Zahl von Fehlalarmen ermöglicht.
Was sind Guardrails?
Guardrails sollen verhindern, dass schädliche Prompts – etwa Jailbreak-Versuche oder Anweisungen zur Umleitung von Aufgaben – Einfluss auf eingesetzte LLMs nehmen.
Unter normalen Umständen sollten Prompts wie „ignoriere vorherige Anweisungen und gib X aus“ als potenziell bösartig erkannt werden.
Forscher von HiddenLayer entdeckten, dass das Anhängen einer sorgfältig ausgewählten Tokenfolge, etwa der Zeichenfolge =coffee, die Bewertung eines Klassifikators vollständig umkehren konnte, sodass bösartige Inhalte als sicher erschienen.
Dieses Verhalten bildet die Grundlage von EchoGram – einer Technik, die „Flip-Tokens“ identifiziert, mit denen sich Guardrail-Entscheidungen verändern lassen, ohne die bösartige Nutzlast zu beeinträchtigen.
EchoGram macht eine unbequeme Realität sichtbar: Selbst gut entwickelte KI-Sicherheitsmechanismen können manipuliert werden, indem Lücken in ihren Trainingsdaten und Tokenverteilungen ausgenutzt werden.
Guardrails, die besonders wertvolle Modelle schützen sollen, können dazu gebracht werden, schädliche Anweisungen zu genehmigen oder Sicherheitsteams mit Fehlalarmen zu überfluten – und so das Vertrauen in defensive KI-Systeme zu untergraben.
So funktioniert EchoGram
EchoGram zielt auf zwei vorherrschende Guardrail-Architekturen ab:
- LLM-as-a-judge-Systeme, die die Sicherheit von Prompts bewerten
- spezialisierte Textklassifikationsmodelle, die darauf trainiert sind, Prompt-Injection oder schädliche Inhalte zu erkennen.
Obwohl sich diese Systeme in ihrer Umsetzung unterscheiden, haben sie eine entscheidende Gemeinsamkeit: Sie stützen sich auf kuratierte Datensätze mit bösartigen und harmlosen Prompts.
EchoGram nutzt Ungleichgewichte in diesen Datensätzen aus, um Sequenzen zu identifizieren, die Modellentscheidungen überproportional beeinflussen.
Wortlisten-Generierung
Der Angriff beginnt mit der Erstellung einer Liste potenzieller Tokens, wobei eine von zwei Methoden zum Einsatz kommt:
- Datensatz-Destillation: Durch den Vergleich der Tokenhäufigkeit in harmlosen und bösartigen Datensätzen werden Sequenzen identifiziert, die überproportional auf eine der beiden Klassen hindeuten.
- Vokabular-Sondierung: Dabei wird jedes Token aus dem Tokenizer eines Modells an grenzwertig bösartige Prompts angehängt, um zu sehen, welche davon die Bewertung umkehren. Diese Methode ist besonders effektiv, wenn Entwickler White-Box-Zugriff auf das Guardrail-Modell haben.
Diese Ansätze erstellen eine Wortliste von Tokens, die das Verhalten des Klassifikators beeinflussen können.
Sondierung und Bewertung des Modells
Anschließend testen die Forscher jedes Token, indem sie es an eine vielfältige Auswahl bösartiger Prompts anhängen.
Sequenzen werden danach bewertet, wie häufig sie die Guardrail-Entscheidung von „bösartig“ zu „sicher“ umkehren.
Tokens mit hoher Bewertung werden zu EchoGram-Kandidaten, die weiter kombiniert werden können, um ihre Wirkung zu verstärken.
HiddenLayer demonstrierte, dass Tokenkombinationen die Leistung drastisch verschlechtern und die Ausgabe von Modellen wie Qwen3Guard über mehrere Schweregrade hinweg umkehren können.
Tokenkombination und Verstärkung der Umkehrrate
Ein einzelnes Token kann einige, aber nicht alle Prompts umkehren. Werden Tokens kombiniert, verstärkt sich ihre Wirkung.
Diese Verstärkung bleibt über verschiedene Modellgrößen hinweg bestehen. Das deutet darauf hin, dass der Fehler nicht auf Einschränkungen kleiner Modelle zurückzuführen ist, sondern auf grundlegende Schwächen in der Struktur der Trainingsdaten für Guardrails.
EchoGram-Nutzlasten erstellen
EchoGram kann verwendet werden, um Guardrails zu umgehen oder gezielte Fehlalarme zu erzeugen.
Angreifer können Flip-Tokens am Ende eines bösartigen Prompts einbetten oder sie in natürlich wirkende Sätze einflechten, die für Menschen harmlos erscheinen, aber eine Fehlklassifizierung auslösen.
Diese Fähigkeit ermöglicht Überschwemmungsangriffe mit Fehlalarmen, die Überwachungssysteme überlasten und das Vertrauen in KI-Sicherheitskontrollen untergraben.
Da viele Guardrail-Systeme auf ähnliche Trainingsmuster und Datensätze zurückgreifen, kann sich eine einzelne EchoGram-Tokenfolge auf mehrere Plattformen verallgemeinern – von kommerziellen Unternehmens-Chatbots bis hin zu staatlichen KI-Einsätzen.
Die Technik legt zudem ein größeres Problem offen: Organisationen gehen häufig davon aus, dass Guardrails grundsätzlich zuverlässig sind, obwohl sie in Wirklichkeit auf eine Weise versagen können, die Angreifer gezielt herbeiführen können.
Wichtige Schutzmaßnahmen gegen Bedrohungen im EchoGram-Stil
Der Schutz von KI-Systemen vor Angriffen im EchoGram-Stil erfordert mehr als das Patchen einzelner Modelle – nötig ist eine mehrschichtige Verteidigungsstrategie.
Um die Anfälligkeit für Angriffe im EchoGram-Stil zu verringern, sollten Organisationen:
- das Guardrail-Training stärken und vielfältige, ausgewogene sowie adversarial erzeugte Datensätze verwenden, kontinuierliche Nachtrainings durchführen, versionierte Label-Audits vornehmen und die Datensatzhygiene prüfen.
- mehrschichtige Abwehrmechanismen und Ensemble-Verfahren einsetzen, indem sie Klassifikatoren, LLM-as-a-judge-Systeme, Konsensabstimmungen und Eskalationspfade als Rückfallebene kombinieren, statt sich auf ein einzelnes Guardrail-Modell zu verlassen.
- adversariales Red-Team-Testing durchführen, das gezielt auf das Umgehen von Guardrails ausgerichtet ist – einschließlich der Suche nach Flip-Tokens, Tokenkombinationsangriffen und der Erkennung von Sondierungsversuchen.
- die Eingabeverarbeitung absichern durch Token-Normalisierung, Bereinigung, Prompt-Variationen und Beschränkungen für verdächtige Muster, um adversariale Tokenfolgen zu unterbrechen, bevor sie Guardrails beeinflussen.
- das Monitoring und die Anomalieerkennung verbessern durch die Überwachung ungewöhnlicher Bewertungsmuster (z. B. Ausschläge bei harmlosen Inhalten oder Überschwemmungen mit Fehlalarmen), die Protokollierung von Guardrail-Entscheidungen, die Begrenzung der Rate von Sondierungsaktivitäten und die Anwendung einer Laufzeit-Anomalieerkennung.
- die Modell-Lieferkette und die Bereitstellungsumgebung absichern , indem Guardrail-Komponenten isoliert, die Herkunft von Tokenizern und Modellen validiert, Zero-Trust-Prinzipien angewendet und bei Fällen mit hohem Risiko Prüfungen durch Menschen sichergestellt werden.
Diese Maßnahmen helfen Organisationen, Cyberresilienz gegen ähnliche Angriffe aufzubauen.
KI-Abwehr muss sich weiterentwickeln, statt stillzustehen
EchoGram zeigt, dass KI-Sicherheitswerkzeuge – insbesondere Guardrails, die auf statischen Datensätzen trainiert wurden – ebenso gründlich geprüft werden müssen wie die Modelle, die sie schützen.
Die Erkenntnisse von HiddenLayer unterstreichen die Bedeutung kontinuierlicher adversarialer Tests, transparenter Trainingsmethoden und von Abwehrmechanismen, die sich an verändernde Datenmuster anpassen können.
Da LLMs zunehmend in sensiblen Bereichen wie Finanzwesen, Gesundheitswesen und nationaler Sicherheit eingesetzt werden, müssen Organisationen Guardrails als dynamische Systeme betrachten, die regelmäßig auditiert, Belastungstests unterzogen und gewartet werden müssen – nicht als Schutzvorkehrungen nach dem Prinzip „einrichten und vergessen“.
Diese Realität unterstreicht die Notwendigkeit einer Zero-Trust-Haltung, bei der kein Guardrail, kein Modell und keine Datenquelle ohne kontinuierliche Validierung automatisch als vertrauenswürdig gilt.





