Jailbreaks (LLM) (FA)
جیلبریک (انگلیسی: Jailbreak — به معنای واقعی «فرار از زندان») در زمینه مدلهای زبانی بزرگ (LLM) نوعی حمله تقابلی است که هدف آن دور زدن مکانیزمهای امنیتی و محدودیتهای داخلی به منظور دریافت پاسخهای ممنوع یا بالقوه مضر است[1]. Jailbreak عبارت است از «وادار کردن مدل به تولید پاسخهای مضر که با سیاستهای استفاده و هنجارهای اجتماعی در تضادند، از طریق طراحی promptهای تقابلی»[2].
آسیبپذیری بنیادی که در حملات jailbreak مورد بهرهبرداری قرار میگیرد، در ویژگی معماری LLM نهفته است: مدلها نمیتوانند دستورالعملها و دادهها را بر اساس نوعشان از یکدیگر تمییز دهند، زیرا هم promptهای سیستمی و هم ورودی کاربر فرمت یکسانی دارند — رشتههای متنی به زبان طبیعی[3].
تاریخچه پیدایش و توسعه
دوره اولیه: Prompt Injectionها (۲۰۲۲)
اولین کشف مستند آسیبپذیری prompt injection در ماه می ۲۰۲۲ رخ داد، زمانی که پژوهشگران شرکت Preamble حساسیت ChatGPT به این گونه حملات را کشف کردند. در سپتامبر ۲۰۲۲، Riley Goodside به طور مستقل اولین نمایش عمومی آسیبپذیری GPT-3 را در Twitter منتشر کرد، با مثال معروفی که در آن به مدل دستور داده میشد دستورالعملهای قبلی را نادیده بگیرد[4].
دوران DAN (۲۰۲۲–۲۰۲۳)
در اواسط ۲۰۲۲، اولین promptهای "Do Anything Now" (DAN) ظاهر شدند که دستورالعملهایی برای بازی نقش بودند. نوآوری کلیدی، استفاده از بازی نقش برای دور زدن محدودیتهای امنیتی از طریق ایجاد «شخصیت جایگزین» آزاد از قوانین بود[5]. تکامل DAN به ظهور سناریوهای پیچیده با سیستمهای token (مکانیزمهای تنبیه/پاداش) و مکانیزمهای حفظ شخصیت انجامید[6].
تنوع روشها (۲۰۲۳–۲۰۲۴)
از سال ۲۰۲۳، پژوهشهای جامع دانشگاهی درباره حملات jailbreak آغاز شد. در سال ۲۰۲۴، حملات چندوجهی ظهور کردند که شامل پنهان کردن دستورالعملهای مضر در تصاویر، فایلهای صوتی، و همچنین visual prompt injection از طریق ASCII-art بودند[7].
دوره معاصر (۲۰۲۴–۲۰۲۵)
تکنیکهای حمله به پیچیدهتر شدن ادامه میدهند. در نوامبر ۲۰۲۴، تکنیک "Time Bandit" کشف شد که با طرح سؤالات گویی از دورههای تاریخی (سدههای ۱۸۰۰–۱۹۰۰)، از سردرگمی زمانی در ChatGPT-4o بهره میبرد[8].
روشهای فنی و طبقهبندی
حملات را میتوان بر اساس دسترسی به مدل طبقهبندی کرد:
- حملات جعبه سیاه: بدون دسترسی به اجزای داخلی مدل (پارامترها، گرادیانها).
- حملات جعبه سفید: با دسترسی کامل به پارامترها و گرادیانهای مدل[2].
طبقهبندی JailbreakRadar
طبقهبندی JailbreakRadar (Chu et al., 2024) شش دسته اصلی حمله را تعریف میکند:
- حملات مستقیم: promptهای مضر بلافصل.
- حملات غیرمستقیم: راهبردهای دستکاری چندمرحلهای.
- حملات زمینهای: استفاده از تاریخچه مکالمه.
- حملات نقشآفرینی: تکنیکهای تقلید شخصیت (مانند DAN).
- حملات رمزگذاری: روشهای obfuscation برای پنهان کردن دستورالعملهای مضر.
- حملات الگویی: چارچوبهای تقابلی ساختاریافته[9].
مکانیزمهای فنی
- تولید پسوندهای تقابلی (GCG): روشی که توسط Zou et al. (2023) پیشنهاد شده، بهصورت خودکار پسوندهای تقابلی (دنبالههای token) تولید میکند که با افزوده شدن به prompt، با احتمال بالایی پاسخ مضر ایجاد میکنند. این روش از بهینهسازی مبتنی بر گرادیان استفاده میکند و نرخ موفقیت بالایی (تا ۸۴٪ روی GPT-4) و قابلیت انتقال بین مدلها نشان میدهد[10].
- جیلبریکینگ چندمرحلهای: پژوهش Anthropic (2024) نشان داد که اثربخشی حملات از قانون توانی پیروی میکند: با افزایش تعداد نمونههای مضر در prompt، درصد پاسخهای ناخواسته افزایش مییابد[11].
مکانیزمهای دفاعی
- طبقهبندیکنندههای قانون اساسی (Anthropic): فیلترسازی دادههای ورودی/خروجی بر اساس مجموعهای از اصول قانون اساسی. این روش توانست نرخ موفقیت jailbreak را از ۸۶٪ به ۴.۴٪ در ارزیابیهای کنترلشده کاهش دهد[12].
- Reinforcement Learning from Human Feedback (RLHF): آموزش سهمرحلهای (OpenAI) شامل تنظیم دقیق نظارتشده، آموزش مدل پاداش و بهینهسازی سیاست، کاهش چشمگیری در تولید محتوای سمی نشان داده است.
- آموزش تقابلی: آموزش مدل با نمونههای حملات jailbreak برای افزایش مقاومت آن. اثربخشی این رویکرد در کاهش نرخ موفقیت حملات بین ۶۰ تا ۸۰٪ ارزیابی شده است[1].
- دفاع چندلایه: راهبرد توصیهشده شامل اعتبارسنجی دادههای ورودی، حفاظت در سطح مدل، نظارت بر دادههای خروجی و پایش مستمر در زمان واقعی.
حملات jailbreak به مدلهای زبانی بزرگ یک مشکل امنیتی بنیادی در هوش مصنوعی را نشان میدهند و تنش دائمی میان قابلیتها و همسویی مدلها را آشکار میسازند. چشمانداز حملات پیوسته در حال پیچیدهتر شدن است و از prompt injectionهای ساده به حملات چندوجهی و خودکار پیشرفته تبدیل میشود. پژوهشها نشان میدهند که هیچ مکانیزم دفاعی کنونی در برابر تمام تلاشهای jailbreak کاملاً مقاوم نیست. موفقیت در این حوزه مستلزم سرمایهگذاری مستمر در پژوهشهای امنیتی، رویههای افشای مسئولانه و تلاش مشترک پژوهشگران، صنعت و نهادهای نظارتی است.
پیوندها
- Prompting Guide: Jailbreaking
- مخزن پیادهسازی حمله GCG در GitHub
منابع
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
یادداشتها
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [۱]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [۲]
- ↑ «Jailbreaking LLMs». Prompting Guide. [۳]
- ↑ «Exploring prompt injection attacks». NCC Group. [۴]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [۵]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [۶]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [۸]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [۹]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [۱۰]
- ↑ «Many-shot Jailbreaking». Anthropic. [۱۱]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [۱۲]