Synthetic data generation — تولید داده مصنوعی
تولید دادههای مصنوعی با استفاده از LLM — فناوریای است برای ساخت مصنوعی دادههایی که از نظر ویژگیهای آماری و ساختاری، دادههای واقعی را تقلید میکنند، اما حاوی اطلاعات شخصی واقعی نیستند. این رویکرد که از قابلیتهای مدلهای زبانی بزرگ (LLM) بهره میبرد، به ابزاری کلیدی در یادگیری ماشین مدرن برای حل مشکلات کمبود داده، حریم خصوصی و هزینه بالای برچسبگذاری دستی تبدیل شده است[1].
تعریف و پیشزمینه
دادههای مصنوعی چیست؟
دادههای مصنوعی اطلاعاتی هستند که به صورت مصنوعی تولید میشوند و ویژگیهای آماری و الگوهای مجموعه داده واقعی و اولیه را بازتولید میکنند. مؤسسه ملی استانداردها و فناوری آمریکا (NIST) آنها را به عنوان دادههایی تعریف میکند که ویژگیهای آماری اصل را حفظ میکنند، اما جزئیات فردی را آشکار نمیسازند[2]. برخلاف ناشناسسازی ساده، سنتز داده رکوردهای کاملاً جدیدی ایجاد میکند که سطح حفاظت از حریم خصوصی بالاتری را تضمین مینماید.
چرا این نیاز به وجود آمد؟
افزایش علاقه به تولید مصنوعی داده ناشی از عوامل متعددی است:
- کمبود داده: در بسیاری از حوزهها، به ویژه حوزههای تخصصی، دادههای برچسبخورده باکیفیت برای آموزش مدلهای robust کافی نیست.
- هزینه بالای برچسبگذاری: برچسبگذاری دستی دادهها فرایندی زمانبر و پرهزینه است.
- الزامات حریم خصوصی: هنجارهای حقوقی و اخلاقی (از جمله GDPR) استفاده از دادههای واقعی حاوی اطلاعات شخصی، پزشکی یا مالی را محدود میکنند.
- عدم تعادل کلاسها: در دادههای واقعی، برخی رویدادهای مهم اما نادر (edge cases) ممکن است به اندازه کافی نمایندگی نشوند و این موضوع مانع یادگیری آنها توسط مدل میشود.
LLMها که بر روی مجموعههای عظیمی از متن و کد آموزش دیدهاند، ابزاری قدرتمند برای حل این مشکلات شدهاند، زیرا قادرند محتوای منسجم و متنوعی تولید کنند که سبکها و توزیعهای دادههای واقعی را تقلید میکند.
روشهای اصلی تولید با استفاده از LLM
چندین رویکرد کلیدی برای ایجاد دادههای مصنوعی با استفاده از LLM وجود دارد.
۱. تولید مبتنی بر دستور (Prompt-based)
این روش مستقیمی است که در آن LLM بر اساس یک درخواست متنی (prompt) داده تولید میکند.
- Zero-shot (از صفر): مدل بر اساس توضیح وظیفه و بدون ارائه نمونه، مثال تولید میکند. این رویکرد تنوع را ترویج میدهد، اما ممکن است به نتایج کمتر مرتبط منجر شود.
- Few-shot (با چند نمونه): چند نمونه (مثال) از خروجی مطلوب در prompt گنجانده میشود. این امر مدل را هدایت کرده و ارتباط دادههای تولیدشده را افزایش میدهد، اما خطر تکرار و کاهش تنوع را به همراه دارد، زیرا مدل تمایل دارد الگوها را کپی کند[1].
۲. تولید با تکمیل اطلاعات خارجی (Retrieval-Augmented)
این روش با هدف افزایش صحت واقعی دادههای مصنوعی و کاهش خطر توهم (hallucination) طراحی شده است. مدل صرفاً به دانش درونی خود متکی نیست، بلکه از بافت ارائهشده از یک منبع خارجی معتبر استفاده میکند. برای مثال، برای تولید جفت «سؤال-جواب»، ابتدا یک بند مرتبط از ویکیپدیا استخراج میشود و سپس از LLM خواسته میشود سؤال و پاسخی کاملاً بر اساس همان متن فرموله کند.
۳. بهبود تکراری و خودآموزی (Self-Refinement)
این دسته از روشها از یک حلقه بازخورد برای بهبود کیفیت داده استفاده میکند. شناختهشدهترین نمونه، روش Self-Instruct است[1].
- مدل مجموعه داده اولیهای تولید میکند.
- این دادهها برای fine-tuning خود مدل (یا نسخهای از آن) استفاده میشوند.
- خطاها و نقاط ضعف مدل بر روی دادههای تولیدشده تحلیل میشود.
- از مدل خواسته میشود نمونههای جدید و پیچیدهتری مشابه آنچه اشتباه کرده، تولید کند.
دقیقاً بر اساس همین طرح بود که مجموعه داده مشهور Stanford Alpaca ساخته شد — ۵۲۰۰۰ جفت «دستورالعمل-پاسخ» که توسط مدل GPT-3 تولید شدند و امکان fine-tuning مدل متنباز LLaMA را به سطح یک دستیار پیرو دستورالعمل فراهم کردند.
۴. پسپردازش و فیلترکردن
پس از تولید داده، همیشه فیلترکردن برای حذف نمونههای بیکیفیت اعمال میشود. روشها از ساده (حذف موارد تکراری، بررسی فرمت) تا پیچیده متفاوتند، از جمله:
- استفاده از مدل ناقد: یک طبقهبند مجزا آموزش میبیند که دادههای واقعی را از مصنوعی تشخیص میدهد و کمترین نمونههای واقعبینانه را حذف میکند.
- فیلترکردن بر اساس اطمینان: تنها نمونههایی که LLM با اطمینان بالا پاسخ/برچسب صحیح را برای آنها پیشبینی میکند، نگه داشته میشوند.
- وزندهی داده: به نمونههایی که مشکوک به خطا یا توهم هستند، وزن کمتری در تابع زیان هنگام آموزش تعلق میگیرد تا تأثیر منفی آنها کاهش یابد (روش SunGen).
۵. آموزش با بازخورد اجرایی (Execution Feedback)
این روش به ویژه برای تولید کد برنامهنویسی مؤثر است. برخلاف متن زبان طبیعی، کد دارای معیار رسمی صحت است — میتوان آن را اجرا کرد. چرخه به این شکل است:
- LLM کدی برای حل یک مسئله تولید میکند.
- کد به صورت خودکار اجرا شده و با تستها بررسی میشود.
- راهحلهای صحیح در مجموعه آموزشی گنجانده میشوند. موارد نادرست کنار گذاشته میشوند، یا مدل سیگنالی (reward) برای تصحیح خطا دریافت میکند.
کاربردهای دادههای مصنوعی
- بهبود وظایف در شرایط کمبود داده: دادههای مصنوعی زمانی مؤثرترند که دادههای واقعی برچسبخورده کم باشد. پژوهشها نشان میدهند افزودن ۱۰۰ نمونه مصنوعی به ۱۰۰ نمونه واقعی میتواند دقت طبقهبند را ۳ تا ۲۶ درصد افزایش دهد[3].
- ایجاد مجموعههای دستورالعمل (Instruction Tuning): پروژههایی مانند Alpaca و Code Alpaca نشان دادند که با استفاده از LLM میتوان مجموعه دادههای بزرگ و باکیفیت برای آموزش مدلهای دستیار تقریباً از صفر ایجاد کرد.
- جستجوی اطلاعات و پاسخ به سؤالات (QA): روش InPars از LLM برای تولید پرسوجوهای جستجو برای اسناد موجود استفاده میکند. این امر امکان ایجاد خودکار جفتهای «سؤال — سند مرتبط» برای آموزش موتورهای جستجو را فراهم میکند.
- حفاظت از حریم خصوصی: در پزشکی و مالی، دادههای مصنوعی برای آموزش مدلها بدون دسترسی به دادههای شخصی واقعی استفاده میشوند. برای مثال، وزارت امور ایثارگران آمریکا در طول پاندمی COVID-19 دادههای پزشکی مصنوعی برای تبادل اطلاعات تولید کرد[2].
مزایا و خطرات
مزایا
- کاهش هزینه و تسریع توسعه: تولید داده توسط مدل به مراتب ارزانتر و سریعتر از برچسبگذاری دستی است.
- مقیاسپذیری: دادههای مصنوعی را میتوان در حجمهای تقریباً نامحدود تولید کرد.
- قابلیت کنترل: توسعهدهنده میتواند به انعطافپذیری ترکیب، سبک و پیچیدگی دادههای تولیدشده را تنظیم کند.
- رعایت حریم خصوصی: جایگزینی ناشناس برای کار با دادههای حساس فراهم میکنند.
- استحکام مدلها (Robustness): آموزش بر روی نمونههای مصنوعی متنوع و حتی «دشوار» مدلها را کمتر مستعد بیشبرازش و مقاومتر در برابر ورودیهای غیرمعمول میکند.
محدودیتها و خطرات
- نادرستیهای واقعی (توهمات): LLMها میتوانند حقایق نادرستی تولید کنند که با گنجانده شدن در مجموعه آموزشی، در مدلهای جدید تثبیت میشوند.
- واقعبینی ناکافی: متنهای مصنوعی ممکن است بیش از حد قالبی، رسمی یا فاقد تنوع زبان زنده باشند که قدرت تعمیمپذیری مدل را کاهش میدهد.
- تقویت تعصبات سیستماتیک (Bias): LLMها کلیشههای اجتماعی و پیشداوریهای موجود در دادههای آموزشی خود را به ارث میبرند و میتوانند آنها را تشدید کنند.
- خطر «فروپاشی مدل»: پدیدهای که در آن آموزش مجدد مدلها بر روی دادههای تولیدشده توسط نسخههای قبلی مدلها، به کاهش تدریجی کیفیت و «فراموش کردن» پدیدههای نادر منجر میشود.
- احتمال نشت حریم خصوصی: بدون اقدامات ویژه (مثلاً حریم خصوصی دیفرانسیل)، LLMها ممکن است به طور تصادفی بخشهایی از دادههای واقعی مجموعه آموزشی خود را بازتولید کنند که خطر شناسایی هویت را به همراه دارد[4].
چشمانداز و جهتهای پژوهشی
- خودکارسازی انتخاب دستور: توسعه روشهایی که به طور خودکار بهترین promptها را برای تولید دادههای باکیفیت پیدا میکنند.
- تولید مصنوعی چندوجهی (Multimodal): گسترش روششناسیها به تولید دادههای ترکیبی (متن + تصویر، صدا، ویدیو).
- توسعه معیارهای کیفیت: ایجاد benchmark های استانداردشده برای ارزیابی سودمندی، تنوع و واقعبینی دادههای مصنوعی.
- مدیریت تعصبات: توسعه روشهایی برای کنترل و کاهش تعصب در دادههای تولیدشده، برای مثال از طریق تولید نمونههای خلاف واقع (counterfactual).
- استقرار ایمن در صنعت: توسعه استانداردهای حقوقی و اخلاقی برای استفاده از دادههای مصنوعی در حوزههای حساس.
پیوندها
- مقاله مروری: Synthetic Data Generation Using Large Language Models (2025)
- وبلاگ Google Research درباره تولید داده با حریم خصوصی دیفرانسیل
منابع
- Ye, J. et al. (2025). Synthetic Data Generation Using Large Language Models: Advances in Text and Code. arXiv:2503.14023.
- Wang, Y. et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
- Gao, J. et al. (2022). Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. arXiv:2205.12679.
- Jeronymo, V. et al. (2023). InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval. arXiv:2301.01820.
- Li, Z. et al. (2023). Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations. ACL 2023.
- Shumailov, I. et al. (2023). Nepotistically Trained Generative-AI Models Collapse. arXiv:2311.12202.
- Long, L. et al. (2024). On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey. ACL Findings 2024.
- Gao, J. C. et al. (2024). Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Synthetic Datasets. OpenReview.
- Gehring, J. et al. (2025). RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning. arXiv:2410.02089.
- Barr, A. A. et al. (2025). Large Language Models Generating Synthetic Clinical Datasets: A Feasibility and Comparative Analysis with Real-World Perioperative Data. Frontiers in AI.
- Rao, H. et al. (2025). A Scoping Review of Synthetic Data Generation for Biomedical Research and Applications. arXiv:2506.16594.
یادداشتها
- ↑ 1.0 1.1 1.2 Ye, J., et al. «Synthetic Data Generation Using Large Language Models: Advances in Text and Code». arXiv:2503.14023 [cs.CL], 20 марта 2025 г. [۱]
- ↑ 2.0 2.1 «Federal chief data officers seek information on synthetic data generation». FedScoop. [۲]
- ↑ Li, Zhuoyan, et al. «Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations». ACL Anthology, 2023. [۳]
- ↑ Schoen, F. P., et al. «Large language models generating synthetic clinical datasets: a feasibility and comparative analysis with real-world perioperative data». Frontiers in Artificial Intelligence, 2025. [۴]