Jailbreaks (LLM) (DE)
Jailbreak (englisch für „Ausbruch aus dem Gefängnis“) ist im Kontext von großen Sprachmodellen (LLM) eine Art von adversarialem Angriff, dessen Ziel es ist, die integrierten Sicherheitsmechanismen und Einschränkungen zu umgehen, um verbotene oder potenziell schädliche Antworten zu erhalten[1]. Ein Jailbreak ist das „Verleiten eines Modells zur Generierung schädlicher Antworten, die den Nutzungsrichtlinien und gesellschaftlichen Normen widersprechen, durch die Entwicklung adversarieller Prompts“[2].
Die grundlegende Schwachstelle, die bei Jailbreak-Angriffen ausgenutzt wird, liegt in einer architektonischen Besonderheit von LLMs: Die Modelle können nicht zwischen Anweisungen und Daten nach ihrem Typ unterscheiden, da sowohl System-Prompts als auch Benutzereingaben das gleiche Format haben – Textzeichenfolgen in natürlicher Sprache[3].
Entstehungs- und Entwicklungsgeschichte
Frühphase: Prompt-Injections (2022)
Die erste dokumentierte Entdeckung der Anfälligkeit für Prompt-Injections erfolgte im Mai 2022, als Forscher des Unternehmens Preamble die Anfälligkeit von ChatGPT für solche Angriffe feststellten. Im September 2022 veröffentlichte Riley Goodside unabhängig davon die erste öffentliche Demonstration der Schwachstelle von GPT-3 auf Twitter mit dem bekannten Beispiel, bei dem dem Modell befohlen wurde, vorherige Anweisungen zu ignorieren[4].
Die DAN-Ära (2022–2023)
Mitte 2022 erschienen die ersten „Do Anything Now“ (DAN)-Prompts, die Anweisungen für ein Rollenspiel darstellten. Die entscheidende Innovation war die Nutzung des Rollenspiels, um Sicherheitsbeschränkungen durch die Schaffung einer von Regeln befreiten „alternativen Persönlichkeit“ zu umgehen[5]. Die Entwicklung von DAN führte zur Entstehung komplexer Szenarien mit Token-Systemen (Bestrafungs-/Belohnungsmechanismen) und Mechanismen zur Aufrechterhaltung der Persona[6].
Diversifizierung der Methoden (2023–2024)
Ab 2023 begannen umfassende akademische Forschungen zu Jailbreak-Angriffen. Im Jahr 2024 traten multimodale Angriffe auf, die das Verstecken schädlicher Anweisungen in Bildern, Audiodateien sowie visuelle Prompt-Injections mittels ASCII-Art umfassten[7].
Aktuelle Periode (2024–2025)
Die Angriffstechniken werden immer komplexer. Im November 2024 wurde die Technik „Time Bandit“ entdeckt, die eine zeitliche Verwirrung in ChatGPT-4o ausnutzt, indem Fragen so formuliert werden, als stammten sie aus historischen Perioden (1800er-1900er Jahre)[8].
Technische Methoden und Klassifikation
Angriffe können nach dem Zugriff auf das Modell klassifiziert werden:
- Black-Box-Angriffe: Ohne Zugriff auf die internen Komponenten des Modells (Parameter, Gradienten).
- White-Box-Angriffe: Mit vollem Zugriff auf die Modellparameter und Gradienten[2].
Taxonomie von JailbreakRadar
Die Klassifikation von JailbreakRadar (Chu et al., 2024) unterscheidet sechs Hauptkategorien von Angriffen:
- Direkte Angriffe: Unmittelbare schädliche Prompts.
- Indirekte Angriffe: Mehrstufige Manipulationsstrategien.
- Kontextbezogene Angriffe: Nutzung des Gesprächsverlaufs.
- Rollenspiel-Angriffe: Techniken zur Nachahmung von Charakteren (z. B. DAN).
- Kodierungsangriffe: Obfuskationsmethoden zum Verbergen schädlicher Anweisungen.
- Vorlagenbasierte Angriffe: Strukturierte adversarielle Frameworks[9].
Technische Mechanismen
- Generierung adversarieller Suffixe (GCG): Eine von Zou et al. (2023) vorgeschlagene Methode, die automatisch adversarielle Suffixe (Token-Sequenzen) generiert, die bei Hinzufügung zu einem Prompt mit hoher Wahrscheinlichkeit eine schädliche Antwort hervorrufen. Die Methode verwendet Gradientenoptimierung und zeigt eine hohe Erfolgsrate (bis zu 84 % bei GPT-4) sowie Übertragbarkeit zwischen Modellen[10].
- Many-Shot Jailbreaking: Eine Untersuchung von Anthropic (2024) zeigte, dass die Effektivität von Angriffen einem Potenzgesetz folgt: Mit zunehmender Anzahl schädlicher Beispiele im Prompt steigt der Prozentsatz unerwünschter Antworten[11].
Schutzmechanismen
- Konstitutionelle KI (Anthropic): Filterung von Eingabe- und Ausgabedaten auf der Grundlage eines Satzes konstitutioneller Prinzipien. Diese Methode ermöglichte es, die Erfolgsrate von Jailbreaks in kontrollierten Bewertungen von 86 % auf 4,4 % zu senken[12].
- Bestärkendes Lernen durch menschliches Feedback (RLHF): Ein dreistufiger Trainingsprozess (OpenAI), der überwachtes Fine-Tuning, das Trainieren eines Belohnungsmodells und die Optimierung der Richtlinien umfasst, hat eine signifikante Reduzierung der Generierung toxischer Inhalte gezeigt.
- Adversariales Training: Das Trainieren des Modells an Beispielen von Jailbreak-Angriffen, um seine Widerstandsfähigkeit zu erhöhen. Die Wirksamkeit dieses Ansatzes bei der Reduzierung der Erfolgsrate von Angriffen wird auf 60–80 % geschätzt[1].
- Mehrstufiger Schutz: Eine empfohlene Strategie, die die Validierung von Eingabedaten, Schutz auf Modellebene, Überwachung der Ausgabedaten und kontinuierliches Echtzeit-Monitoring umfasst.
Jailbreak-Angriffe auf große Sprachmodelle stellen ein fundamentales Problem der KI-Sicherheit dar und demonstrieren die ständige Spannung zwischen den Fähigkeiten und dem Alignment der Modelle. Die Angriffslandschaft wird ständig komplexer und entwickelt sich von einfachen Prompt-Injections zu komplizierten multimodalen und automatisierten Angriffen. Forschungen zeigen, dass kein aktueller Schutzmechanismus vollständig gegen alle Jailbreak-Versuche resistent ist. Erfolg in diesem Bereich erfordert kontinuierliche Investitionen in die Sicherheitsforschung, Praktiken der verantwortungsvollen Offenlegung (Responsible Disclosure) und gemeinsame Anstrengungen von Forschern, Industrie und Regulierungsbehörden.
Weblinks
Literatur
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). “Do Anything Now”: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Einzelnachweise
- ↑ 1.0 1.1 „A brief history of jailbreaking“. Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. „Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey“. arXiv:2405.09443. [2]
- ↑ „Jailbreaking LLMs“. Prompting Guide. [3]
- ↑ „Exploring prompt injection attacks“. NCC Group. [4]
- ↑ „Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models“. arXiv:2308.03825. [5]
- ↑ „0xk1h0/ChatGPT_DAN“. GitHub. [6]
- ↑ „ChatGPT "Time-travel" jailbreak lets you bypass its safety guards“. BleepingComputer. [8]
- ↑ Chu, Z., et al. „JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense“. arXiv:2402.12642. [9]
- ↑ Zou, A., et al. „Universal and Transferable Adversarial Attacks on Aligned Language Models“. arXiv:2307.15043. [10]
- ↑ „Many-shot Jailbreaking“. Anthropic. [11]
- ↑ „How we're using 'constitutional AI' to make our models safer“. MIT Technology Review. [12]