Jailbreaks (LLM) (FA)

From Systems analysis wiki
Jump to navigation Jump to search

جیلبریک (انگلیسی: Jailbreak — به معنای واقعی «فرار از زندان») در زمینه مدل‌های زبانی بزرگ (LLM) نوعی حمله تقابلی است که هدف آن دور زدن مکانیزم‌های امنیتی و محدودیت‌های داخلی به منظور دریافت پاسخ‌های ممنوع یا بالقوه مضر است[1]. Jailbreak عبارت است از «وادار کردن مدل به تولید پاسخ‌های مضر که با سیاست‌های استفاده و هنجارهای اجتماعی در تضادند، از طریق طراحی prompt‌های تقابلی»[2].

آسیب‌پذیری بنیادی که در حملات jailbreak مورد بهره‌برداری قرار می‌گیرد، در ویژگی معماری LLM نهفته است: مدل‌ها نمی‌توانند دستورالعمل‌ها و داده‌ها را بر اساس نوعشان از یکدیگر تمییز دهند، زیرا هم prompt‌های سیستمی و هم ورودی کاربر فرمت یکسانی دارند — رشته‌های متنی به زبان طبیعی[3].

تاریخچه پیدایش و توسعه

دوره اولیه: Prompt Injection‌ها (۲۰۲۲)

اولین کشف مستند آسیب‌پذیری prompt injection در ماه می ۲۰۲۲ رخ داد، زمانی که پژوهشگران شرکت Preamble حساسیت ChatGPT به این گونه حملات را کشف کردند. در سپتامبر ۲۰۲۲، Riley Goodside به طور مستقل اولین نمایش عمومی آسیب‌پذیری GPT-3 را در Twitter منتشر کرد، با مثال معروفی که در آن به مدل دستور داده می‌شد دستورالعمل‌های قبلی را نادیده بگیرد[4].

دوران DAN (۲۰۲۲–۲۰۲۳)

در اواسط ۲۰۲۲، اولین prompt‌های "Do Anything Now" (DAN) ظاهر شدند که دستورالعمل‌هایی برای بازی نقش بودند. نوآوری کلیدی، استفاده از بازی نقش برای دور زدن محدودیت‌های امنیتی از طریق ایجاد «شخصیت جایگزین» آزاد از قوانین بود[5]. تکامل DAN به ظهور سناریوهای پیچیده با سیستم‌های token (مکانیزم‌های تنبیه/پاداش) و مکانیزم‌های حفظ شخصیت انجامید[6].

تنوع روش‌ها (۲۰۲۳–۲۰۲۴)

از سال ۲۰۲۳، پژوهش‌های جامع دانشگاهی درباره حملات jailbreak آغاز شد. در سال ۲۰۲۴، حملات چندوجهی ظهور کردند که شامل پنهان کردن دستورالعمل‌های مضر در تصاویر، فایل‌های صوتی، و همچنین visual prompt injection از طریق ASCII-art بودند[7].

دوره معاصر (۲۰۲۴–۲۰۲۵)

تکنیک‌های حمله به پیچیده‌تر شدن ادامه می‌دهند. در نوامبر ۲۰۲۴، تکنیک "Time Bandit" کشف شد که با طرح سؤالات گویی از دوره‌های تاریخی (سده‌های ۱۸۰۰–۱۹۰۰)، از سردرگمی زمانی در ChatGPT-4o بهره می‌برد[8].

روش‌های فنی و طبقه‌بندی

حملات را می‌توان بر اساس دسترسی به مدل طبقه‌بندی کرد:

  • حملات جعبه سیاه: بدون دسترسی به اجزای داخلی مدل (پارامترها، گرادیان‌ها).
  • حملات جعبه سفید: با دسترسی کامل به پارامترها و گرادیان‌های مدل[2].

طبقه‌بندی JailbreakRadar

طبقه‌بندی JailbreakRadar (Chu et al., 2024) شش دسته اصلی حمله را تعریف می‌کند:

  1. حملات مستقیم: prompt‌های مضر بلافصل.
  2. حملات غیرمستقیم: راهبردهای دستکاری چندمرحله‌ای.
  3. حملات زمینه‌ای: استفاده از تاریخچه مکالمه.
  4. حملات نقش‌آفرینی: تکنیک‌های تقلید شخصیت (مانند DAN).
  5. حملات رمزگذاری: روش‌های obfuscation برای پنهان کردن دستورالعمل‌های مضر.
  6. حملات الگویی: چارچوب‌های تقابلی ساختاریافته[9].

مکانیزم‌های فنی

  • تولید پسوندهای تقابلی (GCG): روشی که توسط Zou et al. (2023) پیشنهاد شده، به‌صورت خودکار پسوندهای تقابلی (دنباله‌های token) تولید می‌کند که با افزوده شدن به prompt، با احتمال بالایی پاسخ مضر ایجاد می‌کنند. این روش از بهینه‌سازی مبتنی بر گرادیان استفاده می‌کند و نرخ موفقیت بالایی (تا ۸۴٪ روی GPT-4) و قابلیت انتقال بین مدل‌ها نشان می‌دهد[10].
  • جیلبریکینگ چندمرحله‌ای: پژوهش Anthropic (2024) نشان داد که اثربخشی حملات از قانون توانی پیروی می‌کند: با افزایش تعداد نمونه‌های مضر در prompt، درصد پاسخ‌های ناخواسته افزایش می‌یابد[11].

مکانیزم‌های دفاعی

  • طبقه‌بندی‌کننده‌های قانون اساسی (Anthropic): فیلترسازی داده‌های ورودی/خروجی بر اساس مجموعه‌ای از اصول قانون اساسی. این روش توانست نرخ موفقیت jailbreak را از ۸۶٪ به ۴.۴٪ در ارزیابی‌های کنترل‌شده کاهش دهد[12].
  • Reinforcement Learning from Human Feedback (RLHF): آموزش سه‌مرحله‌ای (OpenAI) شامل تنظیم دقیق نظارت‌شده، آموزش مدل پاداش و بهینه‌سازی سیاست، کاهش چشمگیری در تولید محتوای سمی نشان داده است.
  • آموزش تقابلی: آموزش مدل با نمونه‌های حملات jailbreak برای افزایش مقاومت آن. اثربخشی این رویکرد در کاهش نرخ موفقیت حملات بین ۶۰ تا ۸۰٪ ارزیابی شده است[1].
  • دفاع چندلایه: راهبرد توصیه‌شده شامل اعتبارسنجی داده‌های ورودی، حفاظت در سطح مدل، نظارت بر داده‌های خروجی و پایش مستمر در زمان واقعی.

حملات jailbreak به مدل‌های زبانی بزرگ یک مشکل امنیتی بنیادی در هوش مصنوعی را نشان می‌دهند و تنش دائمی میان قابلیت‌ها و همسویی مدل‌ها را آشکار می‌سازند. چشم‌انداز حملات پیوسته در حال پیچیده‌تر شدن است و از prompt injection‌های ساده به حملات چندوجهی و خودکار پیشرفته تبدیل می‌شود. پژوهش‌ها نشان می‌دهند که هیچ مکانیزم دفاعی کنونی در برابر تمام تلاش‌های jailbreak کاملاً مقاوم نیست. موفقیت در این حوزه مستلزم سرمایه‌گذاری مستمر در پژوهش‌های امنیتی، رویه‌های افشای مسئولانه و تلاش مشترک پژوهشگران، صنعت و نهادهای نظارتی است.

پیوندها

  • Prompting Guide: Jailbreaking
  • مخزن پیاده‌سازی حمله GCG در GitHub

منابع

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

یادداشت‌ها

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [۱]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [۲]
  3. «Jailbreaking LLMs». Prompting Guide. [۳]
  4. «Exploring prompt injection attacks». NCC Group. [۴]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [۵]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [۶]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [۷]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [۸]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [۹]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [۱۰]
  11. «Many-shot Jailbreaking». Anthropic. [۱۱]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [۱۲]