Forscher haben eine neue Methode demonstriert, mit der Angreifer einen der vertrauenswürdigsten Sicherheitsmechanismen von KI in ein Verteilungssystem für Schadcode verwandeln können.
Durch die Manipulation von Genehmigungsdialogen mit Human-in-the-Loop (HITL) können Angreifer Nutzer dazu bringen, Aktionen zu autorisieren, die zur Ausführung beliebigen Codes führen – ohne dass sie bemerken, dass etwas nicht stimmt.
Der Angriff „… kann Nutzer dazu bringen, einen Remote-Code-Execution-Angriff zu genehmigen, der aus indirekten Prompt-Injection-Angriffen hervorgeht“, sagten Checkmarx-Forscher.
Die verborgenen Risiken von KI-Genehmigungs-Workflows
Human-in-the-Loop-(HITL)-Kontrollen werden als Schutz gegen Prompt Injection und übermäßige KI-Autonomie empfohlen, insbesondere bei agentenbasierten Systemen wie Code-Assistenten, die Betriebssystembefehle ausführen können.
Viele Organisationen verlassen sich auf diese Genehmigungsdialoge als letzte Verteidigungslinie, weil sie davon ausgehen, dass die Bestätigung durch den Nutzer katastrophale Folgen verhindert.
Der Lies-in-the-Loop-(LITL)-Angriff stellt diese Annahme infrage. Er zeigt, dass Angreifer die HITL-Schutzmechanismen nicht umgehen müssen – sie können einfach manipulieren, was der Nutzer sieht.
Die Technik betrifft Entwicklertools, KI-Code-Assistenten und andere privilegierte Agenten, die in Umgebungen wie VS-Code-Terminals und chatbasierten IDE-Erweiterungen ausgeführt werden.
Der Angriff durch gefälschte HITL-Dialoge
Auf hoher Ebene nutzt der LITL-Angriff indirekte Prompt Injection, um den Kontext des Agenten zu vergiften. Der Angreifer liefert schädliche Anweisungen, die die KI später in einen dem Nutzer angezeigten HITL-Dialog einbettet.
Der zugrunde liegende Befehl ist zwar schädlich, doch der Dialog ist so gestaltet, dass er harmlos wirkt und zur Genehmigung auffordert.
Mehrere Techniken machen diese Täuschung effektiver.
Eine Methode nutzt Padding: Angreifer hängen große Mengen harmlos wirkenden Textes an oder stellen ihn voran, um die schädliche Nutzlast aus dem sichtbaren Bereich des Dialogs zu verdrängen.
Selbst beim Scrollen werden möglicherweise nur harmlose Inhalte sichtbar, was den Verdacht verringert.
Ein weiterer Angriffsvektor ist die Manipulation von Metadaten. Einige Agenten zeigen eine kurze Beschreibung an, die zusammenfasst, was der Befehl tun wird.
Forscher zeigten, dass auch diese Beschreibungszeile manipuliert werden kann, sodass die Benutzeroberfläche behauptet, der Agent führe eine sichere Aktion aus, während tatsächlich etwas völlig anderes geschieht.
Am bedenklichsten ist die Markdown-Injection. Viele HITL-Dialoge werden mit Markdown oder HTML dargestellt.
Wenn diese Inhalte nicht ordnungsgemäß bereinigt werden, können Angreifer Formatierungsgrenzen aufbrechen, schädliche Befehle verbergen oder gefälschte UI-Elemente einschleusen.
In Tests zeigte sich, dass Microsoft Copilot Chat Markdown nicht ordnungsgemäß bereinigte, sodass eingeschleuste Inhalte unter den richtigen Bedingungen auf eine Weise dargestellt werden konnten, die Nutzer plausibel täuschen könnte.
Obwohl bei Proof-of-Concept-Demonstrationen nur harmlose Programme wie calc.exegestartet wurden, betonten die Forscher, dass dieselbe Technik für weitaus zerstörerischere Aktionen eingesetzt werden könnte.
Risiken durch den Missbrauch von KI-Genehmigungen verringern
Da LITL-Angriffe stark auf dem Vertrauen der Nutzer beruhen, erfordert ihre Eindämmung sowohl technische Kontrollen als auch ein Bewusstsein für die Gefahren. Organisationen, die agentenbasierte KI-Tools einsetzen, sollten:
- Nutzer darüber aufklären, dass HITL-Dialoge manipuliert werden können und sie darin schulen, Dialoginhalte, Formatierung und visuelle Grenzen vor der Genehmigung von Aktionen kritisch zu prüfen.
- KI-Tools mit gut gestalteten, strukturierten Benutzeroberflächen bevorzugen und die Abhängigkeit von terminalbasierten Oberflächen minimieren, in denen sich schädliche Inhalte leichter verbergen lassen.
- Agentenrechte nach dem Prinzip der geringsten Rechte und Zero Trust beschränken und sicherstellen, dass sensible Aktionen zusätzliche Kontrollen über die HITL-Genehmigung im Kontext hinaus erfordern.
- Kontrollen zur Befehlsvalidierung wie Allowlists, Richtlinienprüfungen oder eine Trennung zwischen Befehlserstellung und -ausführung durchsetzen, um unsichere Vorgänge zu verhindern.
- Überwachen und prüfen Sie das Verhalten von Agenten, indem Sie HITL-Dialoginhalte, Genehmigungsentscheidungen und ausgeführte Aktionen protokollieren, um Missbrauch zu erkennen und forensische Analysen zu unterstützen.
- Mehrschichtige Genehmigungs- und Integritätsschutzmechanismen für risikoreiche Aktionen ergänzen, darunter eine Bestätigung über einen separaten Kanal, Konsistenzprüfungen von Dialogen und eingeschränkte Kontexteingaben.
Zwar beseitigt keine einzelne Kontrolle das Risiko vollständig, doch ein mehrschichtiger Ansatz, der das Bewusstsein der Nutzer mit technischen Schutzmaßnahmen verbindet, kann die Widerstandsfähigkeit spürbar verbessern.
Wenn Vertrauen zur Angriffsfläche wird
Lies-in-the-Loop-Angriffe spiegeln eine umfassendere Realität der modernen Sicherheit wider: Mechanismen, die Vertrauen durchsetzen sollen, werden zunehmend selbst zu Angriffsflächen.
Da KI-Agenten mehr Autonomie und tieferen Zugriff auf Systeme erhalten, wenden sich Angreifer zunehmend davon ab, technische Kontrollen direkt zu durchbrechen.
Stattdessen konzentrieren sie sich darauf, menschliche Einschätzungen und Genehmigungs-Workflows zu manipulieren, bei denen eine einzige vertrauensbasierte Entscheidung weitreichende Aktionen autorisieren kann.
Da Vertrauen selbst zum Angriffspunkt wird, setzen Unternehmen zunehmend auf Zero-Trust-Prinzipien, die Annahmen eines standardmäßigen Vertrauens beseitigen.





