AIxploit
AIxploit kartiert die neue Angriffsfläche von KI-Agenten
AIxploit untersucht Prompt-Injection-Angriffsflächen von KI-Agenten
KI-Agenten schaffen eine neue Klasse von Schwachstellen, die sich nicht allein im Code finden lässt. Entscheidend kann bereits sein, wie eine manipulierte Anweisung formuliert, eingebettet oder gegenüber dem Modell legitimiert wird. TrendAI Research will diese bislang schwer greifbare Angriffsfläche mit dem Framework „AIxploit“ systematisch messbar machen.
Prompt Injection wird zur systematischen Angriffsklasse
Mit zunehmender Autonomie von KI-Agenten verändert sich auch die Sicherheitsprüfung. Ein Agent, der auf Datenbanken, Dateien oder andere Werkzeuge zugreifen darf, kann legitime Berechtigungen gegen das eigene Unternehmen einsetzen, wenn manipulierte Inhalte seine Entscheidungslogik beeinflussen.
TrendAI bezeichnet dieses Angriffsmuster als „Return-to-Tool“: Der Angreifer muss nicht selbst Zugriff auf ein privilegiertes Werkzeug erhalten. Stattdessen bringt er den KI-Agenten dazu, dessen eigene autorisierte Funktionen für einen unerwünschten Zweck einzusetzen. Entscheidend ist dabei häufig nicht eine klassische Software-Schwachstelle, sondern die Formulierung und Einbettung einer Anweisung.
Genau hier setzt AIxploit an . Das automatisierte Security-Testing-Framework soll unterschiedliche Prompt-Injection-Varianten generieren, gegen reale Agenten ausführen und anschließend überprüfen, ob tatsächlich eine unerwünschte Aktion stattgefunden hat. Dadurch soll aus einzelnen erfolgreichen Prompt-Injection-Experimenten eine systematisch erfassbare Angriffsfläche werden.
Drei Szenarien zeigen die möglichen Folgen
TrendAI untersuchte AIxploit anhand von drei Angriffsszenarien. Dabei ging es um ransomwareähnliche Verschlüsselung, das Umgehen eines eigentlich schreibgeschützten Datenbankzugriffs sowie den Diebstahl von KYC-Daten.
Im ersten Szenario sollte ein KI-Agent eigentlich Support-Tickets priorisieren. Eine manipulierte Anweisung innerhalb der verarbeiteten Daten sollte den Agenten jedoch dazu bewegen, Kundendaten in der Datenbank zu verschlüsseln.
Im zweiten Test arbeitete der Agent mit einer eigentlich nur lesbaren PostgreSQL-Datenbank. Ziel des Angriffs war es, diese Grenze zu überwinden und vertrauliche Informationen aus einer Token-Tabelle in andere Datenbankbereiche zu kopieren.
Beim dritten Szenario wurde eine Prompt Injection in OCR-Daten eines Identitätsdokuments eingebettet. Der Agent sollte regulär Pass- und Führerscheindaten extrahieren, stattdessen aber Informationen anderer Kunden in den neuen Datensatz übernehmen.
Die Tests zeigen damit ein zentrales Problem agentischer Systeme: Ein Agent kann technisch genau die Berechtigungen besitzen, die er für seine Arbeit benötigt – und trotzdem zum Sicherheitsrisiko werden, wenn nicht vertrauenswürdige Eingaben sein Verhalten beeinflussen.
Nicht jeder Angriff sieht wie ein Angriff aus
Besonders schwierig ist die enorme Variabilität von Prompt-Injection-Angriffen. Zwei Anweisungen können für Menschen nahezu identisch wirken, von einem Sprachmodell jedoch völlig unterschiedlich interpretiert werden.
AIxploit erzeugt deshalb verschiedene Injection-Varianten entlang unterschiedlicher Dimensionen. Dazu gehören unter anderem Autoritätsargumente, vermeintliche Vorbedingungen, Compliance-Druck, konkrete Handlungsanweisungen und technische Nachahmung. Ziel ist es, nicht lediglich bekannte Prompts geringfügig umzuschreiben, sondern unterschiedliche Angriffsmuster zu erzeugen.
Die Tests werden anschließend in isolierten Docker-Umgebungen ausgeführt. Dadurch lassen sich selbst erfolgreiche oder destruktive Angriffe kontrolliert untersuchen, ohne produktive Infrastruktur zu gefährden.
Entscheidend ist zudem die Erfolgskontrolle: AIxploit bewertet nicht nur die Antwort eines Modells, sondern überprüft den tatsächlichen Zustand der Umgebung nach dem Test. Erst wenn beispielsweise Daten kopiert oder verschlüsselt wurden, gilt eine Injection als erfolgreicher Angriff.
Gemeinsame blinde Flecken verschiedener KI-Modelle
Besonders relevant sind die Ergebnisse dort, wo identische oder ähnliche Angriffsmuster bei Modellen unterschiedlicher Anbieter funktionieren.
TrendAI testete in seinen Szenarien jeweils 200 generierte Injections gegen zwölf Modelle. Dabei konnten erfolgreiche Angriffe auf mehrere Frontier-Modelle bestätigt werden. Einige Injection-Familien funktionierten modell- und teilweise herstellerübergreifend. TrendAI wertet dies als Hinweis darauf, dass bestimmte Schwächen nicht ausschließlich bei einzelnen Modellen auftreten, sondern aus gemeinsamen Problemen beim Umgang mit eingebetteten beziehungsweise entsprechend gerahmten Anweisungen entstehen können.
Die Aussagekraft der Tests bleibt allerdings begrenzt. TrendAI weist selbst darauf hin, dass 200 Prompts pro Angriffskategorie nur einen vergleichsweise kleinen Ausschnitt darstellen. Zudem reagieren generative Modelle probabilistisch: Ein Prompt, der während eines Tests erfolgreich war, muss beim nächsten Versuch nicht zwangsläufig dasselbe Ergebnis produzieren.
Für die Sicherheitsbewertung ändert dies wenig. Bereits eine einzelne erfolgreiche Manipulation kann ausreichen, um sensible Daten auszulesen, Datenbankgrenzen zu überwinden oder Daten zu verschlüsseln.
Wenn selbst die Sicherheitsmechanismen vom Kontext abhängen
Ein weiteres Ergebnis der Untersuchung zeigt, wie stark Sicherheitsmechanismen vom Kontext abhängen können. Bei der automatisierten Erzeugung von Angriffsprompts blockierten Sicherheitsmechanismen teilweise die weitere Generierung.
Nach Angaben der Forscher genügte in einigen Fällen bereits eine banalere Benennung des Arbeitsverzeichnisses, damit derselbe Prozess anschließend fortgesetzt werden konnte. Eine identische Aufgabe könne damit abhängig von ihrer Einbettung unterschiedlich bewertet werden.
Gerade für Unternehmensanwendungen ist dieser Punkt relevant: Sicherheitsprüfungen dürfen sich nicht darauf beschränken, einzelne bekannte „bösartige“ Prompts zu blockieren. Entscheidend ist vielmehr, wie sich Modelle unter unterschiedlichen Formulierungen, Kontexten und Prozessketten tatsächlich verhalten.
KI-Agenten brauchen ihre eigene Form des Fuzzings
Die Entwicklung erinnert an frühere Phasen der IT-Sicherheit. Netzwerke bekamen Portscanner, Webanwendungen Fuzzer und Software automatisierte Schwachstellenanalysen. Für agentische KI-Systeme beginnt sich derzeit eine vergleichbare Testmethodik herauszubilden.
AIxploit versucht genau diese Lücke zu schließen: Nicht der einzelne erfolgreiche Prompt soll im Mittelpunkt stehen, sondern die Frage, welche Klassen von Formulierungen einen konkreten Agenten dazu bringen können, seine vorgesehenen Grenzen zu überschreiten.
Für Unternehmen entsteht daraus eine wichtige Konsequenz: Die Sicherheit eines KI-Agenten lässt sich nicht allein aus Modellwahl, Berechtigungen oder statischen Guardrails ableiten. Agenten müssen vielmehr unter realistischen Bedingungen kontinuierlich mit manipulierten Eingaben konfrontiert werden.
Je stärker KI-Agenten mit Datenbanken, SaaS-Diensten, Identitäten und produktiven Geschäftsprozessen verbunden werden, desto wichtiger wird diese Form des adversarial Testing. Die eigentliche Angriffsfläche liegt künftig nicht mehr ausschließlich im Code – sondern zunehmend auch darin, welche Anweisungen eine Maschine bereit ist zu glauben.