OpenAI hat ein Sicherheitsupdate für seinen browserbasierten ChatGPT-Atlas-Agenten veröffentlicht, um Prompt-Injection-Angriffe abzuwehren.
Das Update führt neue Abwehrmechanismen auf Modell- und Systemebene ein, die verhindern sollen, dass in Webinhalten verborgene schädliche Anweisungen den Nutzerwillen außer Kraft setzen.
Ein Angreifer „… könnte eine schädliche E-Mail senden und versuchen, einen Agenten dazu zu bringen, die Anfrage des Nutzers zu ignorieren und stattdessen sensible Steuerunterlagen an eine vom Angreifer kontrollierte E-Mail-Adresse weiterzuleiten“, sagte OpenAI über Prompt-Injection-Angriffe.
Prompt-Injection bei KI-Agenten verstehen
Prompt-Injection-Angriffe nutzen die Tatsache aus, dass KI-Agenten Anweisungen in natürlicher Sprache aus mehreren Quellen interpretieren.
Indem sie gegnerische Anweisungen in scheinbar harmlosen Inhalten — etwa einer E-Mail, einem Dokument oder einer Webseite — verstecken, versuchen Angreifer, die ursprüngliche Anfrage des Nutzers außer Kraft zu setzen und das Verhalten des Agenten umzulenken.
Da ChatGPT Atlas viele der Aktionen ausführen kann, die auch ein Nutzer in einem Browser ausführen kann — E-Mails senden, auf Cloud-Dateien zugreifen oder Transaktionen abschließen — sind die potenziellen Auswirkungen eines erfolgreichen Angriffs erheblich.
Im Gegensatz zu herkömmlichen Webangriffen setzt Prompt-Injection weder Software-Schwachstellen noch Benutzerfehler voraus, wodurch sie mit traditionellen Sicherheitskontrollen schwerer zu erkennen und einzudämmen ist.
Wie OpenAI automatisiertes Red-Teaming einsetzt
Um neuen Angriffen einen Schritt voraus zu sein, hat OpenAI ein automatisiertes Red-Teaming-System entwickelt, das auf bestärkendem Lernen basiert.
Das System nutzt große Sprachmodelle als automatisierte Angreifer und trainiert sie darauf, ausgefeilte Prompt-Injection-Techniken zu entdecken, die sich über lange, mehrstufige Abläufe erstrecken.
Wenn das System eine neue Klasse erfolgreicher Angriffe erkennt, löst es sofort eine schnelle Reaktionsschleife aus.
OpenAI trainiert aktualisierte Agentenmodelle gegnerisch darauf, den neu entdeckten Techniken zu widerstehen, und verankert die Widerstandsfähigkeit direkt im Modell.
Angriffsspuren werden außerdem genutzt, um die Überwachung, Sicherheitsanweisungen und die den Agenten umgebenden Abwehrmechanismen auf Systemebene zu stärken.
So lassen sich Prompt-Injection-Risiken mindern
Um das Risiko von Prompt-Injection zu verringern, müssen KI-Agenten als teilweise vertrauenswürdige Akteure und nicht als vollständig autonome Nutzer betrachtet werden.
Zusätzlich zu Schutzvorkehrungen auf Modellebene sollten Unternehmen operative Kontrollen einführen, die die Befugnisse der Agenten begrenzen, ihre Aussetzung gegenüber nicht vertrauenswürdigen Eingaben beschränken und mehr Transparenz über das Verhalten der Agenten schaffen.
- Beschränken Sie den angemeldeten Zugriff und schränken Sie die Berechtigungen des Agenten ein, damit KI-Agenten bei jeder Aufgabe nur mit den unbedingt erforderlichen Befugnissen arbeiten.
- Verwenden Sie explizite, eng gefasste Prompts und vermeiden Sie weitreichende Anweisungen, die Agenten großen Interpretationsspielraum beim Umgang mit nicht vertrauenswürdigen Inhalten geben.
- Verlangen Sie für sensible Aktionen eine zusätzliche Bestätigung oder eine sekundäre Genehmigung wie Datenweitergabe, Finanztransaktionen oder Systemänderungen.
- Beschränken Sie den Zugriff des Agenten je nach Aufgabe auf bestimmte Websites, Tools und Ressourcen, um die Aussetzung gegenüber nicht vertrauenswürdigen oder unnötigen Eingaben zu verringern.
- Überwachen und protokollieren Sie das Verhalten des Agenten, um Abweichungen von der Absicht des Nutzers, anomale Aktionen oder Abweichungen von der ursprünglichen Anfrage des Nutzers zu erkennen.
- Isolieren Sie KI-Agenten von zentralen Systemen und wenden Sie Ausführungsbegrenzungen oder Ratenkontrollen an, um den Schadensradius im Falle einer Prompt-Injection zu verringern.
Zusammen helfen diese Kontrollen, den Schadensradius zu begrenzen und das Risiko von Prompt-Injection in agentengesteuerten Abläufen zu verringern.
Der durch KI-Agenten vorangetriebene Wandel in der Sicherheit
Prompt-Injection verdeutlicht einen umfassenderen Wandel in der Cybersicherheit, da KI-Systeme autonomer werden und zunehmend in alltägliche Abläufe eingebettet sind.
Da Agenten zunehmend in der Lage sind, nicht vertrauenswürdige Inhalte zu interpretieren und im Namen der Nutzer Aktionen in der realen Welt auszuführen, verlieren traditionelle Sicherheitsmodelle, die auf statischen Berechtigungen und Perimeterschutz basieren, an Wirksamkeit.
Diese Entwicklung erfordert von Unternehmen, neu zu überdenken, wie Vertrauen, Verifizierung und Aufsicht auf KI-gesteuerte Systeme angewendet werden, die in dynamischen Umgebungen agieren.
Als Reaktion setzen viele Unternehmen auf Zero-Trust-Prinzipien , um implizites Vertrauen auszuschließen und eine kontinuierliche Verifizierung in KI-gesteuerten Abläufen durchzusetzen.





