KI-Penetrationstests ist noch eine relativ neue Kategorie, und der Begriff umfasst sehr unterschiedliche Produkte, die unter dem gleichen Begriff zusammengefasst werden. Einige Tools verhalten sich eher wie automatisierte Scanner (DAST , die mit LLM-Technologie aufgemotzt wurden), während andere Anwendungsabläufe untersuchen, mehrstufige Angriffe versuchen und die Ergebnisse anhand eines Live-Systems validieren. Daher ist es wichtig, über die Terminologie hinauszuschauen und zu bewerten, was das Produkt in der Praxis tatsächlich leistet.
In unserem Bericht „State of AI in Pentesting“ haben wir 200 CISOs und 200 Führungskräfte aus dem technischen Bereich befragt. 76 % gaben an, dass sie wöchentlich oder noch häufiger wesentliche Änderungen veröffentlichen, doch nur 21 % überprüfen die Sicherheit bei jedem Release. Genau dafür sind KI-basierte Penetrationstests gedacht.
Diese Checkliste umfasst die Bereiche, die unserer Meinung nach bei der Bewertung eines Anbieters für „KI-Penetrationstests “ am wichtigsten sind, darunter Validierung und Signalqualität, Testtiefe, Code-Zugriff, Betriebssicherheit, Onboarding, technische Sicherheitsvorkehrungen, Modellflexibilität sowie die Frage, wie gut sich die Tests in Ihren bestehenden Entwicklungs-Workflow einfügen.
Eine einfache Möglichkeit, die Bewertung aussagekräftiger zu gestalten, besteht darin, bei jedem Anbieter direkten Zugriff anzufordern und den Test live zu verfolgen, anstatt lediglich die Abschlussberichte zu vergleichen. Achten Sie darauf, dass der Testumfang vergleichbar ist, machen Sie sich ein Bild davon, wie viel Aufwand erforderlich war, um die einzelnen Tests zum Laufen zu bringen, und berücksichtigen Sie, wie viel Budget oder Testkapazität jeder Anbieter in Anspruch genommen hat. So erhalten Sie einen viel genaueren Vergleich, bei dem wirklich Äpfel mit Äpfeln verglichen werden.
KI-Penetrationstests Bewertungskriterien auf einen Blick
- Validierung und Signalqualität: Die Ergebnisse liefern Belege, auf deren Grundlage Sie direkt handeln können
- KI-Penetrationstests-Tiefe: Agenten testen die Grenzen der Berechtigungen und mehrstufige Abläufe in der gesamten Anwendung
- Transparenz und Berichterstattung: Sie können einsehen, was getestet wurde und wie
- Geschwindigkeit und Arbeitsablauf: Die Ergebnisse liegen rechtzeitig vor, um noch von Bedeutung zu sein
- Betriebssicherheit: Tests werden ohne ständige Überwachung durchgeführt
- Umfangskontrolle und Sicherheit: Die Durchsetzung erfolgt im System selbst
- Einrichtung und Einarbeitung: Ein echter Test läuft ohne lange Anlaufphase
- Modellflexibilität: nicht an ein bestimmtes Modell oder einen bestimmten Anbieter gebunden
KI-Penetrationstests Bewertungscheckliste
Die meisten Anbieter machen in einer Demo einen guten Eindruck. Die folgenden Kriterien konzentrieren sich darauf, wie sich ihr Produkt in der Praxis bewährt.
Validierung und Signalqualität
- Die Ergebnisse umfassen eindeutige Belege und sind reproduzierbar.
- Die Probleme werden anhand eines Live-Systems überprüft.
- Die Ergebnisse können direkt und ohne weitere triage
- Die Ergebnisse spiegeln die tatsächlichen Angriffswege wider
Tiefe von KI-Penetrationstests
- Die Tests umfassen Arbeitsabläufe, Rollen und den Anwendungsstatus
- Mehrstufige Probleme können aufgedeckt und bestätigt werden
- Die Tests passen sich dem Verhalten der Anwendung an
- Kann es den Quellcode oder den internen Kontext nutzen, um die Abdeckung zu verbessern?
Der Zugriff auf den Code beeinflusst das Ergebnis hier stärker als jeder andere Faktor auf dieser Liste. Bei mehr als 1.000 KI-gestützten Penetrationstests wurden bei Tests mit Zugriff auf den Code im Median siebenmal mehr hochgradige und kritische Schwachstellen aufgedeckt als bei Tests ohne diesen Zugriff – und das bei etwa halb so hohen Kosten pro Feststellung.
Transparenz und Berichterstattung
- Sie können sehen, was getestet wurde und wie das System darauf reagiert hat
- Es gibt eine übersichtliche Aufzeichnung der während der Tests durchgeführten Maßnahmen
- Die Berichte enthalten genügend Details, um die Probleme nachzuvollziehen.
Geschwindigkeit und Arbeitsablauf passen zusammen
- Ein aussagekräftiger Test kann ohne langwierige Vorbereitung durchgeführt werden
- Die Ergebnisse liegen rechtzeitig vor, um darauf reagieren zu können
- Korrekturen können erneut getestet und bestätigt werden
- Das Testen fügt sich in die Art und Weise ein, wie Ihr Team Software veröffentlicht
Die Ausführungsdauer eines Tests beeinflusst, wie viel vom System tatsächlich abgedeckt wird. Eine Finanzdienstleistungsplattform führte einen 120-stündigen manuellen Penetrationstest durch, der keine Ergebnisse lieferte. Die gleiche Anwendung wurde mit Agenten von „ KI-Penetrationstests “ getestet, die Zugriff auf den Quellcode hatten. Der Test dauerte etwas mehr als zwei Stunden und deckte 13 gültige Probleme auf, darunter drei Befunde mit hohem Schweregrad, die bei der manuellen Prüfung vollständig übersehen worden waren. Bitten Sie die Anbieter, Ihnen neben dem Abschlussbericht auch vergleichbare Zeitangaben vorzulegen.
Betriebssicherheit
- Tests ohne häufige Neustarts abgeschlossen
- Misserfolge sind verständlich, wenn sie auftreten
- Die Läufe erfordern keine ständige Beaufsichtigung
- Das System funktioniert im täglichen Einsatz zuverlässig.
Jedes System fällt gelegentlich aus. Entscheidend ist, wie oft dies geschieht und wie viel Aufwand für die Wiederherstellung erforderlich ist.
Umfangskontrolle und Sicherheit
- Der Geltungsbereich wird während der Ausführung durchgesetzt
- Gültigkeitsbereichseinschränkungen werden im System selbst durchgesetzt, unabhängig von Anweisungen oder Richtlinien.
- Der Zugriff ist auf bestimmte Domänen beschränkt
- Die Produktion wird nur berücksichtigt, wenn dies ausdrücklich konfiguriert wurde.
- Anfragen, die außerhalb des Geltungsbereichs liegen, werden automatisch blockiert
- Bei den Vorabprüfungen werden der Umfang und die Umgebungskonfiguration vor Beginn der Tests überprüft
Fragen Sie nach, wie ein Anbieter mit Agenten umgeht, die sich nicht vorhersehbar verhalten. Philippe Dourassov, Leiter des Bereichs KI-Pentests bei „ Aikido “, drückt es so aus: „Es wird immer fünf Prozent der Agenten geben, die sich nicht immer vernünftig verhalten, und deshalb stellen wir sicher, dass wir uns um diese fünf Prozent kümmern.“ Ein Anbieter, der hier keine klare Antwort gibt, verlässt sich auf das Urteilsvermögen des Modells statt auf eine Schutzvorrichtung auf Systemebene.
Weitere Informationen zur Absicherung von KI-Penetrationstest-Agenten bereits bei der Entwicklung finden Sie hier.
Isolierung und Datenschutz
- Der ausgehende Zugriff und die Datenexfiltration werden während der Ausführung eingeschränkt.
- Die Daten verbleiben innerhalb der genehmigten Umgebungen
- Die Ausführungsumgebungen sind voneinander isoliert
- Tests können überwacht, angehalten und sofort beendet werden
Einrichtung und Einarbeitung
- Ein Test kann ohne langwierigen Einarbeitungsprozess gestartet werden
- Die Konfiguration ist unkompliziert
- Die Authentifizierung und die Konfiguration des Geltungsbereichs laufen stabil.
Oft treten Probleme bereits bei der Einrichtung auf. Wenn der Einstieg schwierig ist, wirkt sich das in der Regel auch auf den späteren Gebrauch aus.
Flexibilität des Modells und Validierungstiefe
- Das Produkt ist nicht an ein bestimmtes KI-Modell oder einen bestimmten Anbieter gebunden.
- Für verschiedene Prüfaufgaben können unterschiedliche Modelle verwendet werden.
- Mehrere Agenten können gleichzeitig erkunden und testen
- Die Agenten können sich während der Tests an das Verhalten der Anwendung anpassen
- Das Testen beschränkt sich nicht auf vordefinierte Schwachstellensignaturen
- Angreifer können mehrstufige Angriffspfade verfolgen und Schwachstellen miteinander verketten
- Die Ergebnisse werden durch einen Vergleich mit einem Live-System bestätigt, sodass keine Rückschlüsse allein aus den Modellausgaben gezogen werden.
- Das Modellverhalten wird während der Ausführung durch technische Sicherheitsvorkehrungen eingeschränkt.
Wenn ein Anbieter diese Kriterien nicht eindeutig erfüllen kann, müssen die Ergebnisse letztendlich manuell überprüft werden, damit sie als zuverlässig gelten können, was den Zweck von „ KI-Penetrationstests “ zunichte macht.
Warnsignale, auf die man achten sollte
- Die Tests werden nicht zuverlässig abgeschlossen
- Die Einrichtung dauert zu lange
- Die Ergebnisse sind nicht bewiesen
- Ergebnisse führen nicht zu Lösungen
- Keine integrierte Wiederholungsprüfung
- Es wird nur das oberflächliche Verhalten getestet
- Der Geltungsbereich wird technisch nicht durchgesetzt
- In der Demo sieht es gut aus, in der Praxis gibt es jedoch Schwierigkeiten
Kurze Checkliste für Lieferanten
- Wird beim Versand ausgeführt
- Bietet die Möglichkeit des Zugriffs auf den Quellcode für eine umfassendere Berichterstattung
- Ermittelt echte, bestätigte Probleme
- Erkennt Logik- und Autorisierungsfehler
- Einfach in Betrieb zu nehmen
- Bleibt innerhalb des festgelegten Rahmens
- Ist schnell genug, um Ihrem Veröffentlichungsplan gerecht zu werden
- Ergebnisse, die Sie reproduzieren können
- Korrekturen werden überprüft
- Passt sich der Art und Weise an, wie Ihr Team Code bereitstellt und Fehler behebt
- Läuft zuverlässig
Praxisbeispiele
Das australische Finanz- und Zahlungsunternehmen Tyro führte vor der Markteinführung eines neuen Gesundheitsprodukts einen Proof-of-Concept durch, bei dem „ KI-Penetrationstests “ mit den bisherigen menschlichen Testern verglichen wurden.
„Unsere bisherigen Penetrationstester benötigten dafür etwa 15 Tage. Wir haben dasselbe mit den KI-basierten Penetrationstests von Aikido durchgeführt. Das dauerte fünfeinhalb Stunden, und es wurden etwa 30 Schwachstellen entdeckt, davon neun mit hohem Schweregrad, während die menschlichen Penetrationstester fünf Schwachstellen fanden, davon eine mit hohem Schweregrad“, sagte Arun Singh, ehemaliger Informationssicherheitsbeauftragter bei Tyro.
Der Plan für die Zukunft sieht vor, die menschlichen Prüfer beizubehalten und durch KI zu ergänzen, um den Umfang zu erweitern: „Unser Plan ist ein Hybridmodell, bestehend aus KI-basierten Penetrationstests und KI-basierten Code-Audits, ergänzt durch eine menschliche Überprüfung durch unsere Pentest-Partner. Die Kosten sind deutlich geringer als bisher, sodass wir mit den vorhandenen Mitteln viel mehr erreichen können.“
Stell es auf die Probe
Der schnellste Weg, diese Checkliste anzuwenden, besteht darin, sich anzusehen, wie die Anbieter selbst arbeiten. Beantragen Sie Zugriff auf die jeweilige Plattform, führen Sie mit jedem Anbieter einen vergleichbaren Test durch und bewerten Sie sie während des Tests anhand der oben genannten Punkte.
Sehen Sie selbst, wie sich diese Kriterien in der Praxis bewähren, oder lesen Sie den vollständigen Leitfaden zum Kauf von KI-Penetrationstests, um einen Einblick in die gesamten Forschungsergebnisse zu erhalten, die dieser Checkliste zugrunde liegen.

