LLM Penetration Testing
Auch bekannt als:LLM Pentest · LLM Security Assessment · LLM Red Teaming
LLM Penetration Testing ist die autorisierte, methodische Sicherheitsprüfung von Systemen, die auf Large Language Models basieren. Während AI Penetration TestingAI Penetration TestingAutorisierte Sicherheitsprüfung von KI- und Machine-Learning-Systemen auf Schwachstellen wie Prompt Injection, Modellextraktion und Trainingsdaten-Leakage. das breite Spektrum von ML-Systemen abdeckt, konzentriert sich der LLM Pentest auf die spezifische Angriffsfläche von Sprachmodellen: Prompt Injection, Output-Manipulation, System-Prompt-Extraktion, RAG-Poisoning (Retrieval-Augmented Generation), Tool- und Function-Call-Missbrauch sowie Datenexfiltration über konversationelle Schnittstellen. Mit der Verbreitung LLM-gestützter Chatbots, Copilots und autonomer Agenten entstehen neuartige SchwachstellenVulnerabilityTechnische oder organisatorische Schwäche, die von einer Bedrohung ausgenutzt werden kann., die spezialisiertes Testen erfordern.
Wer beauftragt diesen Test?
Product-Security-Teams von Unternehmen, die LLM-gestützte Features ausliefern, AI-Safety-Teams, CISOs mit Verantwortung für kundenseitige KI-Produkte und Engineering-Leiter, die LLMs in interne Tools integrieren. Organisationen, die Chatbots, Copilots, KI-Agenten, Dokumentenverarbeitungssysteme oder jedes Produkt bauen, in dem ein LLM nicht vertrauenswürdigen Input verarbeitet, sollten diesen Test beauftragen. Die OWASP Top 10 for LLM Applications haben branchenweit das Bewusstsein geschärft und treiben die Nachfrage aus Compliance- und Risikomanagement-Teams.
Ziel des Tests
Ziel ist die Identifikation von Schwachstellen, die spezifisch für LLM-Deployments sind: Kann ein Angreifer den System-Prompt überschreiben, vertrauliche Anweisungen extrahieren, das Modell über seine Tools zu unautorisierten Aktionen verleiten, die Wissensbasis vergiften, Daten über die Konversation exfiltrieren oder Sicherheitsfilter umgehen? Jedes Finding wird nach Ausnutzbarkeit, Wirkungsradius und geschäftlicher Auswirkung bewertet.
Was wird getestet?
Geprüft wird der gesamte LLM-Integrationsstack: System-Prompts und Instruktionshierarchie, Input-Preprocessing und Prompt-Konstruktionspipelines, Output-Filtering und Sicherheitsmechanismen, Tool- und Function-Calling-Implementierungen (was das LLM tun kann), RAG-Pipelines und Wissensbasis-Integrität, Konversationsgedächtnis und Context-Window-Handling, Rate Limiting und Token-Verbrauchskontrollen, Multi-Turn-Interaktionsmuster, Integration mit nachgelagerten Systemen (Datenbanken, APIs, E-Mail) und die Grenze zwischen LLM-generiertem Content und Anwendungslogik.
Übliche Schwachstellen und Findings
Typische Schwachstellen sind direkte Prompt Injection zur Überschreibung von Systemanweisungen, indirekte Prompt Injection über nutzerbeigesteuerte Dokumente oder vom Modell verarbeitete Webinhalte, System-Prompt-Leakage durch gezielt konstruierte Anfragen, übermäßige Tool-Berechtigungen, die einem LLM-Agenten unbeabsichtigte Aktionen erlauben (Dateizugriff, Datenbankabfragen, API-Aufrufe), RAG-Poisoning durch manipulierte Wissensbasis-Dokumente, PII-Leakage bei Reproduktion von Trainingsdaten oder Context-Window-Inhalten, Token-Limit-Missbrauch zur Herbeiführung von Denial of Service, unsicheres Output-Handling, bei dem LLM-generierter Inhalt als HTML gerendert wird (führt zu XSSCross-Site ScriptingEinschleusen ausführbaren Skriptcodes in Inhalte einer Webanwendung.), Halluzinations-Exploitation zur Erzeugung überzeugender, aber falscher Informationen, unzureichendes Output-Filtering, Context-Window-Manipulation zum Überschreiben früherer Anweisungen und Injection-AngriffeInjection AttackManipuliert Interpreter oder Anwendungen durch eingeschleuste Befehle oder Daten. über LLM-Outputs, die nachgelagerte Systeme erreichen (SQL, Shell-Befehle). Die Testmethodik orientiert sich an den OWASP Top 10 for LLM Applications.
Ablauf eines LLM Penetrationstests
Ein LLM Penetrationstest folgt dem bewährten Pentest-Prozess mit spezifischen Anpassungen für Sprachmodell-Deployments.
Interesse und Erstanfrage — der Kunde beschreibt sein LLM-gestütztes Produkt, den Modellanbieter und die Version sowie den geschäftlichen Anlass für den Test (Pre-Launch, Compliance, Incident-getrieben).
Erstgespräch zum Verständnis der Kundenziele — Tester und Kunde besprechen die LLM-Architektur: welches Modell (proprietär, Open Source, Fine-Tuned), wie es integriert ist (API, Self-Hosted), welche Tools und Funktionen das Modell aufrufen kann, die RAG-Pipeline-Architektur und ob der System-Prompt als vertraulich gilt. Dieses Gespräch bestimmt die Testtiefe über Prompt Injection, Tool-Missbrauch, RAG-Poisoning und Output-Manipulation.
Angebotserstellung und Freigabe — ein Angebot beschreibt Scope, Methodik (mit Verweis auf OWASP Top 10 for LLM Applications), Zeitplan und Deliverables. LLM Pentests können iteratives Scoping erfordern, wenn Tester während des Assessments neue Angriffsvektoren entdecken.
Scope-Definition — Ziele werden präzise dokumentiert: Anwendungs-URLs, API-Endpunkte, Modellversion, verfügbare Tools und Funktionen, RAG-Datenquellen, Testkonten mit verschiedenen Berechtigungsstufen und etwaige Einschränkungen (z. B. kein Fine-Tuning oder Modifikation des Modells).
Letter of Engagement — autorisiert den Test und adressiert explizit, ob Tester System-Prompt-Extraktion, Tool-Missbrauch in der Produktion und Interaktionsvolumen-Limits versuchen dürfen (API-Aufrufe an kommerzielle LLM-Provider verursachen Kosten).
Erstellung weiterer Freigaben — API-Zugangsprovisionierung, Testumgebungs-Setup und Kostenkontrolle. Bei LLMs, die von Drittanbietern gehostet werden, muss der Kunde ggf. Rate-Limit-Erhöhungen oder dedizierte Testinstanzen arrangieren.
Bereitstellung von Informationen je nach Black-/Gray-/White-Box-Ansatz — der Kunde stellt je nach Ansatz System-Prompts, Tool-Definitionen, RAG-Pipeline-Dokumentation, Function-Schemas, Konversationsfluss-Diagramme oder vollen Quellcode bereit. Gray-Box-Testing ist Standard: Tester erhalten die Anwendung, aber nicht unbedingt den System-Prompt, was eine realistische Angreiferperspektive abbildet.
Kick-Off Call — Abstimmung von Testansatz und Kostenmanagement. LLM Pentests können signifikante API-Kosten erzeugen; im Kick-Off werden Budgetgrenzen und Monitoring für den Token-Verbrauch festgelegt.
Durchführung mit laufender Information der Stakeholder — Tester proben das LLM-Deployment systematisch: Prompt Injections über verschiedene Angriffsvektoren, Tests der Tool- und Function-Call-Grenzen, Prüfung der RAG-Integrität, Bewertung des Output-Filterings und Erkundung von Multi-Turn-Exploitation-Ketten. Kritische Findings — System-Prompt-Extraktion, uneingeschränkter Tool-Zugang, Datenexfiltration — werden sofort gemeldet.
Sammlung und Bewertung der Schwachstellen — Findings werden mit exakten Prompts, Modell-Antworten, Reproduktionsschritten und Schweregradbewertungen dokumentiert. LLM-spezifische Auswirkungsfaktoren umfassen den Maßstab des potenziellen Missbrauchs (jeder Nutzer könnte die Schwachstelle ausnutzen), Reputationsrisiko durch Safety-Bypasses und den Umfang der Datenexposition.
Erstellung des Abschlussberichts — umfassende Dokumentation mit Management Summary, detaillierten Findings nach Angriffskategorie (Prompt Injection, Tool-Missbrauch, RAG-Poisoning, Output-Handling), Risikobewertungen und umsetzbaren Behebungsempfehlungen zu System-Prompt-Härtung, Tool-Permission-Scoping, Output-Sanitisierung und Monitoring.
Vorstellung in einer Präsentation — Ergebnisse werden Produkt-, Engineering- und Sicherheitsleitung präsentiert. Demonstrationen erfolgreicher Prompt Injections und Tool-Missbräuche sind besonders wirkungsvoll, um das Risiko für nicht-technische Stakeholder greifbar zu machen.
Projektabschluss — das Engagement endet mit priorisierten Behebungsmaßnahmen, Retest-Planung und Empfehlungen für kontinuierliches LLM-Sicherheitsmonitoring. Da Modellupdates, System-Prompt-Änderungen und RAG-Wissensbasis-Aktualisierungen jeweils neue Risiken einführen, ist periodisches Nachtesten unverzichtbar.
Wer sollte diesen Test wann durchführen lassen?
Jede Organisation, die LLM-gestützte Features bereitstellt, sollte diesen Test beauftragen: vor dem Launch LLM-basierter Produkte, nach System-Prompt- oder Tool-Definitions-Änderungen, nach RAG-Wissensbasis-Aktualisierungen, nach Wechsel oder Update des zugrunde liegenden Modells, für die EU-AI-Act-Compliance (Hochrisiko-Klassifizierung) und nach jedem LLM-bezogenen Sicherheitsvorfall oder öffentlich gewordenen Jailbreak. Organisationen mit kundenseitigen LLM-Agenten sollten mindestens quartalsweise testen, da sich die Prompt-Injection-Landschaft kontinuierlich weiterentwickelt und regelmäßig neue Angriffstechniken auftauchen.
Verwandte Begriffe
- AI Penetration TestingAI Penetration TestingAutorisierte Sicherheitsprüfung von KI- und Machine-Learning-Systemen auf Schwachstellen wie Prompt Injection, Modellextraktion und Trainingsdaten-Leakage.: Die breitere Bewertung von KI/ML-Systemen, deren Spezialisierung der LLM-Test darstellt.
- Penetration TestingPenetration TestingAutorisiertes, methodisches Testen eines Systems auf ausnutzbare Schwachstellen, um sie vor echten Angreifern zu finden.: Die übergreifende Disziplin autorisierter Sicherheitsprüfungen.
- Adversarial Machine LearningAdversarial Machine LearningDisziplin zu Manipulation, Täuschung und Absicherung von Machine-Learning-Modellen.: Techniken zur Manipulation von ML-Modellen durch konstruierte Eingaben.
- GuardrailGuardrailAutomatisierte Vorgabe, die unsichere Konfigurationen verhindert oder begrenzt.: Sicherheitsmechanismen, die LLM-Output in akzeptablen Grenzen halten.
- Injection AttackInjection AttackManipuliert Interpreter oder Anwendungen durch eingeschleuste Befehle oder Daten.: Einschleusen schädlicher Anweisungen in einen Datenkanal zur Veränderung des Systemverhaltens.