Synthetic data generation — কৃত্রিম তথ্য উৎপাদন
LLM ব্যবহার করে সিন্থেটিক ডেটা জেনারেশন হলো এমন একটি প্রযুক্তি যেখানে কৃত্রিমভাবে তথ্য তৈরি করা হয়, যা তার পরিসংখ্যানগত ও কাঠামোগত বৈশিষ্ট্যে বাস্তব তথ্যকে অনুকরণ করে, কিন্তু কোনো প্রকৃত ব্যক্তিগত তথ্য ধারণ করে না। বৃহৎ ভাষা মডেলের (LLM) সক্ষমতা ব্যবহার করা এই পদ্ধতিটি আধুনিক Machine Learning-এ ডেটার স্বল্পতা, গোপনীয়তার সমস্যা এবং ম্যানুয়াল লেবেলিংয়ের উচ্চ ব্যয়ের সমাধানে একটি মূল হাতিয়ারে পরিণত হয়েছে[1]।
সংজ্ঞা ও পটভূমি
সিন্থেটিক ডেটা কী?
সিন্থেটিক ডেটা হলো কৃত্রিমভাবে উৎপন্ন তথ্য, যা একটি মূল, বাস্তব ডেটাসেটের পরিসংখ্যানগত বৈশিষ্ট্য ও ধরন পুনরুৎপাদন করে। মার্কিন যুক্তরাষ্ট্রের জাতীয় মান ও প্রযুক্তি ইনস্টিটিউট (NIST) এটিকে এমন ডেটা হিসেবে সংজ্ঞায়িত করে যা মূলের পরিসংখ্যানগত বৈশিষ্ট্য সংরক্ষণ করে, কিন্তু ব্যক্তিগত বিবরণ প্রকাশ করে না[2]। সাধারণ বেনামীকরণের (anonymization) বিপরীতে, ডেটা সংশ্লেষণ সম্পূর্ণ নতুন রেকর্ড তৈরি করে, যা গোপনীয়তার আরও উচ্চ মাত্রার সুরক্ষা নিশ্চিত করে।
কেন এই প্রয়োজনীয়তা দেখা দিল?
সিন্থেটিক জেনারেশনের প্রতি আগ্রহ বৃদ্ধির পেছনে বেশ কিছু কারণ রয়েছে:
- ডেটার স্বল্পতা: অনেক ক্ষেত্রে, বিশেষত অতি-বিশেষায়িত ডোমেনে, robust মডেল প্রশিক্ষণের জন্য পর্যাপ্ত মানসম্পন্ন লেবেলযুক্ত ডেটা পাওয়া যায় না।
- লেবেলিংয়ের উচ্চ ব্যয়: ডেটার ম্যানুয়াল লেবেলিং একটি শ্রমসাধ্য ও ব্যয়বহুল প্রক্রিয়া।
- গোপনীয়তার প্রয়োজনীয়তা: আইনগত ও নৈতিক বিধিবিধান (যেমন GDPR) ব্যক্তিগত, চিকিৎসা বা আর্থিক তথ্য সম্বলিত বাস্তব ডেটার ব্যবহার সীমিত করে।
- শ্রেণী ভারসাম্যহীনতা: বাস্তব ডেটায় কিছু গুরুত্বপূর্ণ কিন্তু বিরল ঘটনা (edge cases) যথেষ্ট পরিমাণে উপস্থিত নাও থাকতে পারে, যা মডেলের সেগুলো শেখার ক্ষমতাকে বাধা দেয়।
বিশাল টেক্সট ও কোড কর্পাসে প্রশিক্ষিত LLM এই সমস্যাগুলো সমাধানে একটি শক্তিশালী হাতিয়ার হয়ে উঠেছে, কারণ সেগুলো বাস্তব ডেটার শৈলী ও বিতরণ অনুকরণ করে সংগতিপূর্ণ ও বৈচিত্র্যময় বিষয়বস্তু তৈরি করতে সক্ষম।
LLM ব্যবহার করে জেনারেশনের প্রধান পদ্ধতি
LLM ব্যবহার করে সিন্থেটিক ডেটা তৈরির বেশ কয়েকটি মূল পদ্ধতি রয়েছে।
১. Prompt-based জেনারেশন
এটি একটি সরাসরি পদ্ধতি, যেখানে LLM একটি টেক্সট অনুরোধের (prompt) ভিত্তিতে ডেটা তৈরি করে।
- Zero-shot (শূন্য থেকে): মডেলটি কোনো নমুনা না দিয়ে শুধুমাত্র কাজের বিবরণের ভিত্তিতে উদাহরণ তৈরি করে। এই পদ্ধতি বৈচিত্র্য বাড়ায়, কিন্তু কম প্রাসঙ্গিক ফলাফল দিতে পারে।
- Few-shot (কয়েকটি উদাহরণ সহ): prompt-এ কাঙ্ক্ষিত আউটপুটের কয়েকটি উদাহরণ (নমুনা) অন্তর্ভুক্ত করা হয়। এটি মডেলকে দিকনির্দেশনা দেয় এবং উৎপন্ন ডেটার প্রাসঙ্গিকতা বাড়ায়, তবে নকল ও বৈচিত্র্য হ্রাসের ঝুঁকি বহন করে, কারণ মডেল প্যাটার্ন নকল করতে প্রবণ হয়[1]।
২. Retrieval-Augmented জেনারেশন
এই পদ্ধতির লক্ষ্য সিন্থেটিক ডেটার তথ্যগত সঠিকতা বাড়ানো এবং hallucination-এর ঝুঁকি কমানো। মডেলটি শুধুমাত্র তার অভ্যন্তরীণ জ্ঞানের উপর নির্ভর না করে একটি নির্ভরযোগ্য বাহ্যিক উৎস থেকে প্রদত্ত প্রেক্ষাপট ব্যবহার করে। উদাহরণস্বরূপ, একটি "প্রশ্ন-উত্তর" জোড়া তৈরি করতে প্রথমে উইকিপিডিয়া থেকে একটি প্রাসঙ্গিক অনুচ্ছেদ বের করা হয়, তারপর LLM-কে কঠোরভাবে সেই টেক্সটের উপর ভিত্তি করে প্রশ্ন ও উত্তর তৈরি করতে বলা হয়।
৩. Self-Refinement - পুনরাবৃত্তিমূলক পরিশোধন ও স্ব-শিক্ষণ
পদ্ধতির এই শ্রেণীটি ডেটার মান উন্নত করতে একটি feedback loop ব্যবহার করে। সবচেয়ে পরিচিত উদাহরণ হলো Self-Instruct পদ্ধতি[1]।
- মডেলটি একটি প্রাথমিক ডেটাসেট তৈরি করে।
- এই ডেটা মডেলটিকে (বা তার একটি কপি) fine-tuning-এর জন্য ব্যবহার করা হয়।
- উৎপন্ন ডেটায় মডেলের ত্রুটি ও দুর্বলতা বিশ্লেষণ করা হয়।
- মডেলকে যেসব উদাহরণে সে ভুল করেছিল সেগুলোর মতো নতুন, আরও জটিল উদাহরণ তৈরি করতে বলা হয়।
ঠিক এই কাঠামো অনুযায়ী বিখ্যাত Stanford Alpaca ডেটাসেট তৈরি করা হয়েছিল — GPT-3 মডেল দ্বারা উৎপন্ন ৫২,০০০টি "নির্দেশ-প্রতিক্রিয়া" জোড়া, যা উন্মুক্ত মডেল LLaMA-কে নির্দেশ অনুসরণকারী সহকারীর স্তরে fine-tune করতে সক্ষম করেছিল।
৪. পোস্ট-প্রসেসিং ও ফিল্টারিং
ডেটা তৈরির পরে সর্বদা নিম্নমানের উদাহরণ বাদ দিতে ফিল্টারিং প্রয়োগ করা হয়। পদ্ধতিগুলো সহজ (নকল সরানো, ফরম্যাট যাচাই) থেকে জটিল পর্যন্ত হয়, যেমন:
- সমালোচক মডেলের ব্যবহার: একটি পৃথক ক্লাসিফায়ার প্রশিক্ষিত করা হয় যা বাস্তব ডেটা থেকে সিন্থেটিক ডেটা আলাদা করে এবং সবচেয়ে কম বাস্তবসম্মত নমুনাগুলো বাদ দেয়।
- আস্থা-ভিত্তিক ফিল্টারিং: শুধুমাত্র সেই উদাহরণগুলো রাখা হয় যার জন্য LLM উচ্চ আস্থায় সঠিক উত্তর/লেবেল পূর্বাভাস দেয়।
- ডেটা ওজন নির্ধারণ: ত্রুটি বা hallucination-এর জন্য সন্দেহজনক উদাহরণগুলোকে প্রশিক্ষণের loss function-এ কম ওজন দেওয়া হয়, যাতে তাদের নেতিবাচক প্রভাব কমে (SunGen পদ্ধতি)।
৫. Execution Feedback - কার্যকরী ফিডব্যাক সহ শিক্ষণ
এই পদ্ধতিটি প্রোগ্রাম কোড জেনারেশনের জন্য বিশেষভাবে কার্যকর। স্বাভাবিক ভাষার টেক্সটের বিপরীতে, কোডের সঠিকতার একটি আনুষ্ঠানিক মানদণ্ড রয়েছে — এটি চালানো যায়। চক্রটি এভাবে দেখতে লাগে:
- LLM একটি সমস্যা সমাধানের জন্য কোড তৈরি করে।
- কোডটি স্বয়ংক্রিয়ভাবে চালানো হয় এবং পরীক্ষার বিপরীতে যাচাই করা হয়।
- সঠিক সমাধানগুলো প্রশিক্ষণ সেটে অন্তর্ভুক্ত করা হয়। ভুলগুলো বাদ দেওয়া হয়, অথবা মডেল ত্রুটি সংশোধনের জন্য একটি সংকেত (reward) পায়।
সিন্থেটিক ডেটার প্রয়োগ
- ডেটা স্বল্পতার পরিস্থিতিতে কাজের উন্নতি: সিন্থেটিক ডেটা সবচেয়ে কার্যকর যখন বাস্তব লেবেলযুক্ত ডেটা কম থাকে। গবেষণা দেখায় যে ১০০টি বাস্তব উদাহরণে ১০০টি সিন্থেটিক উদাহরণ যোগ করা ক্লাসিফায়ারের নির্ভুলতা ৩–২৬% পর্যন্ত বাড়াতে পারে[3]।
- Instruction Tuning ডেটাসেট তৈরি: Alpaca ও Code Alpaca-র মতো প্রকল্পগুলো প্রমাণ করেছে যে LLM ব্যবহার করে কার্যত শূন্য থেকে সহকারী মডেল প্রশিক্ষণের জন্য বড় ও মানসম্পন্ন ডেটাসেট তৈরি করা সম্ভব।
- তথ্য অনুসন্ধান ও প্রশ্নোত্তর (QA): InPars পদ্ধতি বিদ্যমান নথির জন্য অনুসন্ধান প্রশ্ন তৈরিতে LLM ব্যবহার করে। এটি অনুসন্ধান সিস্টেম প্রশিক্ষণের জন্য স্বয়ংক্রিয়ভাবে "প্রশ্ন — প্রাসঙ্গিক নথি" জোড়া তৈরি করতে দেয়।
- গোপনীয়তা রক্ষা: চিকিৎসা ও আর্থিক ক্ষেত্রে সিন্থেটিক ডেটা বাস্তব ব্যক্তিগত ডেটায় প্রবেশ ছাড়াই মডেল প্রশিক্ষণে ব্যবহৃত হয়। উদাহরণস্বরূপ, মার্কিন যুক্তরাষ্ট্রের ভেটেরান্স বিষয়ক মন্ত্রণালয় COVID-19 মহামারির সময় তথ্য আদান-প্রদানের জন্য সিন্থেটিক চিকিৎসা ডেটা তৈরি করেছিল[2]।
সুবিধা ও ঝুঁকি
সুবিধাসমূহ
- ব্যয় হ্রাস ও উন্নয়ন ত্বরান্বিতকরণ: মডেল দ্বারা ডেটা তৈরি ম্যানুয়াল লেবেলিংয়ের চেয়ে উল্লেখযোগ্যভাবে সস্তা ও দ্রুত।
- মাপযোগ্যতা: সিন্থেটিক ডেটা প্রায় সীমাহীন পরিমাণে তৈরি করা যায়।
- নিয়ন্ত্রণযোগ্যতা: ডেভেলপার উৎপন্ন ডেটার গঠন, শৈলী ও জটিলতা নমনীয়ভাবে কাস্টমাইজ করতে পারেন।
- গোপনীয়তা মেনে চলা: সংবেদনশীল ডেটার সাথে কাজ করার জন্য বেনামী বিকল্প প্রদান করে।
- মডেলের দৃঢ়তা (Robustness): বৈচিত্র্যময় এবং এমনকি "কঠিন" সিন্থেটিক উদাহরণে প্রশিক্ষণ মডেলকে overfitting-এর প্রতি কম প্রবণ এবং অস্বাভাবিক ইনপুটের বিরুদ্ধে আরও সহনশীল করে তোলে।
সীমাবদ্ধতা ও ঝুঁকি
- তথ্যগত অসংগতি (hallucination): LLM ভুল তথ্য তৈরি করতে পারে, যা প্রশিক্ষণ সেটে অন্তর্ভুক্ত হলে নতুন মডেলে স্থায়ী হয়ে যায়।
- অপর্যাপ্ত বাস্তবতা: সিন্থেটিক টেক্সট অতিরিক্ত শাব্লনিক, আনুষ্ঠানিক বা জীবন্ত ভাষার সমস্ত বৈচিত্র্য প্রতিফলিত না করে হতে পারে, যা মডেলের সাধারণীকরণ ক্ষমতা হ্রাস করে।
- সিস্টেমগত bias শক্তিশালীকরণ: LLM তাদের প্রশিক্ষণ ডেটায় উপস্থিত সামাজিক স্টেরিওটাইপ ও পক্ষপাত উত্তরাধিকারসূত্রে পেয়ে এবং বাড়িয়ে তুলতে পারে।
- "মডেল কোল্যাপস"-এর ঝুঁকি: এমন একটি ঘটনা যেখানে মডেলের পূর্ববর্তী সংস্করণ দ্বারা উৎপন্ন ডেটায় বারবার মডেল প্রশিক্ষণ দিলে ধীরে ধীরে মান অবনতি ঘটে এবং বিরল ঘটনাগুলো "ভুলে যাওয়া" হয়।
- গোপনীয়তা লঙ্ঘনের সম্ভাব্য ঝুঁকি: বিশেষ ব্যবস্থা (যেমন differential privacy) ছাড়া LLM তার প্রশিক্ষণ সেট থেকে বাস্তব ডেটার অংশ দুর্ঘটনাক্রমে পুনরুৎপাদন করতে পারে, যা পরিচয় প্রকাশের ঝুঁকি তৈরি করে[4]।
গবেষণার দৃষ্টিভঙ্গি ও দিকনির্দেশনা
- Prompt নির্বাচনের স্বয়ংক্রিয়করণ: এমন পদ্ধতির বিকাশ যা গুণমানসম্পন্ন ডেটা তৈরির জন্য স্বয়ংক্রিয়ভাবে সর্বোত্তম prompt খুঁজে পায়।
- মাল্টিমোডাল সিন্থেটিক জেনারেশন: সম্মিলিত ডেটা (টেক্সট + চিত্র, অডিও, ভিডিও) তৈরিতে পদ্ধতিগতভাবে সম্প্রসারণ।
- মান মেট্রিক্সের উন্নয়ন: সিন্থেটিক ডেটার কার্যকারিতা, বৈচিত্র্য ও বাস্তবতা মূল্যায়নের জন্য মানসম্পন্ন benchmark তৈরি।
- Bias ব্যবস্থাপনা: উৎপন্ন ডেটায় পক্ষপাত নিয়ন্ত্রণ ও হ্রাস করার পদ্ধতি তৈরি, উদাহরণস্বরূপ, counterfactual উদাহরণ তৈরির মাধ্যমে।
- শিল্পে নিরাপদ বাস্তবায়ন: সমালোচনামূলক ক্ষেত্রে সিন্থেটিক ডেটা ব্যবহারের জন্য আইনগত ও নৈতিক মান প্রণয়ন।
তথ্যসূত্র
- পর্যালোচনামূলক নিবন্ধ: Synthetic Data Generation Using Large Language Models (2025)
- differential privacy সহ ডেটা জেনারেশন বিষয়ে Google Research ব্লগ
সাহিত্য
- Ye, J. et al. (2025). Synthetic Data Generation Using Large Language Models: Advances in Text and Code. arXiv:2503.14023.
- Wang, Y. et al. (2022). Self-Instruct: Aligning Language Models with Self-Generated Instructions. arXiv:2212.10560.
- Gao, J. et al. (2022). Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning. arXiv:2205.12679.
- Jeronymo, V. et al. (2023). InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval. arXiv:2301.01820.
- Li, Z. et al. (2023). Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations. ACL 2023.
- Shumailov, I. et al. (2023). Nepotistically Trained Generative-AI Models Collapse. arXiv:2311.12202.
- Long, L. et al. (2024). On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey. ACL Findings 2024.
- Gao, J. C. et al. (2024). Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Synthetic Datasets. OpenReview.
- Gehring, J. et al. (2025). RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning. arXiv:2410.02089.
- Barr, A. A. et al. (2025). Large Language Models Generating Synthetic Clinical Datasets: A Feasibility and Comparative Analysis with Real-World Perioperative Data. Frontiers in AI.
- Rao, H. et al. (2025). A Scoping Review of Synthetic Data Generation for Biomedical Research and Applications. arXiv:2506.16594.
টীকা
- ↑ 1.0 1.1 1.2 Ye, J., et al. «Synthetic Data Generation Using Large Language Models: Advances in Text and Code». arXiv:2503.14023 [cs.CL], 20 марта 2025 г. [১]
- ↑ 2.0 2.1 «Federal chief data officers seek information on synthetic data generation». FedScoop. [২]
- ↑ Li, Zhuoyan, et al. «Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations». ACL Anthology, 2023. [৩]
- ↑ Schoen, F. P., et al. «Large language models generating synthetic clinical datasets: a feasibility and comparative analysis with real-world perioperative data». Frontiers in Artificial Intelligence, 2025. [৪]