Bias in large language models — ডেটা পক্ষপাত ও বড় ভাষা মডেলে bias
বড় ভাষা মডেলে পক্ষপাত (ইংরেজি: bias in large language models) — এটি বড় ভাষা মডেলের (LLM) কার্যক্রমে এমন পদ্ধতিগত বিচ্যুতি, যা এমন উত্তর তৈরি করে যা অন্যায্য বা অসঠিকভাবে বাস্তবতাকে প্রতিফলিত করে এবং সমাজে বিদ্যমান স্টেরিওটাইপগুলিকে পুনরুৎপাদন ও শক্তিশালী করে[1]। যদ্বচ্ছ ত্রুটির বিপরীতে, পক্ষপাত নিয়মিত প্রকৃতির এবং এটি প্রশিক্ষণ ডেটা ও অ্যালগরিদমের বৈশিষ্ট্যের কারণে ঘটে। LLM গণ লিঙ্গ, জাতিগত এবং অন্যান্য স্টেরিওটাইপ পুনরুৎপাদন করতে পারে, যা বিশেষত চিকিৎসা, আইন ও অর্থায়নের মতো দায়িত্বশীল ক্ষেত্রে একটি গুরুতর সমস্যা[2]।
পক্ষপাতের উৎস
LLM-এ পক্ষপাত দুটি প্রধান উৎস থেকে উদ্ভূত হয়: বিকৃত ডেটা এবং অ্যালগরিদমের নিজস্ব বৈশিষ্ট্য।
বিকৃত প্রশিক্ষণ ডেটা
পক্ষপাতের মূল কারণ হলো প্রশিক্ষণ ডেটা, যা বিশ্বে বিদ্যমান ঐতিহাসিক, সামাজিক এবং সাংস্কৃতিক বিচ্যুতিগুলিকে প্রতিফলিত করে। LLM গুলি মানুষের তৈরি ইন্টারনেট, বই ও অন্যান্য উৎস থেকে বিশাল পাঠ্য সংকলনে প্রশিক্ষিত হয়, এবং ফলস্বরূপ, সেগুলিতে থাকা সমস্ত স্টেরিওটাইপ উত্তরাধিকারসূত্রে পায়[3]।
- অসম উপস্থাপনা: যদি ডেটায় নির্দিষ্ট জনসংখ্যাগত গোষ্ঠীগুলি (যেমন, জাতিগত সংখ্যালঘু, নির্দিষ্ট পেশায় নারী) পর্যাপ্তভাবে উপস্থাপিত না হয়, তাহলে মডেলটি তাদের সম্পর্কে একটি বিকৃত ধারণা তৈরি করে। উদাহরণস্বরূপ, LLM প্রায়ই "ডাক্তার" শব্দটিকে পুরুষ লিঙ্গের সাথে এবং "নার্স" শব্দটিকে নারী লিঙ্গের সাথে যুক্ত করে, ঐতিহাসিক লিঙ্গ স্টেরিওটাইপ পুনরুৎপাদন করে[1]।
- ঐতিহাসিক ও সাংস্কৃতিক বিচ্যুতি: ডেটা প্রায়ই আধিপত্যশীল সাংস্কৃতিক দৃষ্টিভঙ্গি এবং ঐতিহাসিক পক্ষপাতগুলিকে প্রতিফলিত করে। এই ধরনের পাঠ্যে প্রশিক্ষিত মডেলটি এই দৃষ্টিভঙ্গিগুলি পুনরুৎপাদন করবে, বিকল্প দৃষ্টিভঙ্গিগুলিকে উপেক্ষা করে[4]।
অ্যালগরিদমিক শক্তিবর্ধন
LLM-এর আর্কিটেকচার এবং প্রশিক্ষণ অ্যালগরিদম ডেটায় বিদ্যমান বিচ্যুতিগুলিকে কেবল পুনরুৎপাদনই করে না, বরং শক্তিশালীও করতে পারে। বেশিরভাগ আধুনিক LLM transformer-এর উপর ভিত্তি করে তৈরি এবং পরিসংখ্যানগত নিদর্শনের উপর ভিত্তি করে পরবর্তী শব্দ পূর্বাভাস দেয়। এর ফলে মডেলটি সবচেয়ে ঘন ঘন দেখা যাওয়া pattern-এর দিকে ঝুঁকে পড়ে, যা আধিপত্যশীল মতামত ও স্টেরিওটাইপগুলিকে সুদৃঢ় ও শক্তিশালী করে, যখন বিরল ও অপ্রচলিত ঘটনাগুলিকে উপেক্ষা করা হয়[2]। এই প্রক্রিয়াটি ডেটায় একটি ক্ষুদ্র বিচ্যুতিকে মডেলের উত্তরে স্পষ্ট পক্ষপাতে পরিণত করতে পারে[1]।
পূর্বধারণার ধরন এবং উদাহরণ
সামাজিক ও জনসংখ্যাগত পূর্বধারণা
এটি সবচেয়ে ব্যাপকভাবে অধ্যয়ন করা ধরনের পক্ষপাত, যার মধ্যে লিঙ্গ, জাতি, বয়স, ধর্ম এবং অন্যান্য সামাজিক বৈশিষ্ট্য সম্পর্কিত স্টেরিওটাইপ অন্তর্ভুক্ত।
- লিঙ্গ স্টেরিওটাইপ: LLM প্রায়ই নির্দিষ্ট পেশা ও গুণাবলীকে নির্দিষ্ট লিঙ্গের সাথে যুক্ত করে। উদাহরণস্বরূপ, "শক্তিশালী নেতা" সম্পর্কিত অনুরোধে মডেলটি পুরুষের বর্ণনা তৈরি করার সম্ভাবনা বেশি।
- জাতিগত স্টেরিওটাইপ: মডেলগুলি বিভিন্ন জাতিগত গোষ্ঠী সম্পর্কে নেতিবাচক স্টেরিওটাইপ পুনরুৎপাদন করতে পারে। গবেষণায় দেখা গেছে যে LLM-ভিত্তিক মডারেশন অ্যালগরিদমগুলি আফ্রিকান আমেরিকান কথ্য ভাষায় (AAVE) বার্তাগুলিকে আরও কঠোরভাবে মূল্যায়ন করতে পারে, ভুলভাবে সেগুলিকে আরও আপত্তিকর মনে করে[5]।
- গোষ্ঠীগত পক্ষপাত ("নিজেরা বনাম অন্যরা"): ২০২৪ সালের একটি গবেষণায় দেখা গেছে যে LLM স্পষ্ট গোষ্ঠীগত পক্ষপাত প্রদর্শন করে। একটি নির্দিষ্ট গোষ্ঠীর সাথে সংযুক্ত কোনো ইঙ্গিত পেলে ("আমরা..."), মডেলটি সেই গোষ্ঠীর সম্পর্কে অনুকূলভাবে এবং "অন্যদের" সম্পর্কে অবজ্ঞার সাথে মন্তব্য করে[4]।
কাঠামোগত ও জ্ঞানীয় বিকৃতি
এই বিকৃতিগুলি আর্কিটেকচার এবং তথ্য প্রক্রিয়াকরণের বৈশিষ্ট্যের সাথে সম্পর্কিত।
- অবস্থানগত বিচ্যুতি: ম্যাসাচুসেটস ইনস্টিটিউট অব টেকনোলজির (MIT) একটি গবেষণায় দেখা গেছে যে মডেলগুলি একটি নথির শুরু এবং শেষ থেকে তথ্যকে অসামঞ্জস্যপূর্ণভাবে বিবেচনা করে, প্রায়ই মাঝখানের বিবরণ "মিস" করে। এটি দীর্ঘ পাঠ্যের সাথে কাজ করার সময় নির্ভুলতাকে প্রভাবিত করতে পারে[6]।
- গড়ের দিকে ঝোঁক: সম্ভাব্যতা মডেল হিসাবে, LLM গুলি সবচেয়ে ঘন ঘন (গড়) উত্তর তৈরি করতে প্রবণ থাকে, যা বিরল কিন্তু গুরুত্বপূর্ণ তথ্য, ব্যতিক্রম এবং সংখ্যালঘু মতামত উপেক্ষার দিকে নিয়ে যায়[2]।
- নিশ্চিতকরণ প্রভাব: LLM প্রশিক্ষণ ডেটায় উপস্থিত যুক্তির ধাঁচাগুলি পুনরুৎপাদন করার প্রবণতা দেখাতে পারে, এমনকি সেগুলিতে পূর্বধারণা থাকলেও, এবং বিরোধী তথ্য উপেক্ষা করতে পারে[2]।
বাস্তব উদাহরণ
বিশ্বব্যাংকের একটি গবেষণায় দেখা গেছে যে শরণার্থীদের সাথে সাক্ষাৎকার বিশ্লেষণ করার সময় LLM পদ্ধতিগতভাবে তাদের উৎপত্তি এবং লিঙ্গ অনুসারে তাদের বক্তব্যের অর্থ বিকৃত করেছে। মডেলটি শরণার্থী বাবা-মার তাদের সন্তানদের সাফল্যের আকাঙ্ক্ষাকে ভুলভাবে ব্যাখ্যা করেছে, সম্ভবত প্রধানত "মধ্যবিত্ত শ্বেতাঙ্গ লেখকদের" পাঠ্য দিয়ে গঠিত প্রশিক্ষণ ডেটায় এই ধরনের আখ্যান অনুপস্থিত থাকার কারণে[7][7]।
ঝুঁকি ও পরিণতি
- বৈষম্য বৃদ্ধি: নিয়োগ, ঋণ প্রদান ও আইনশাস্ত্রের মতো ক্ষেত্রে পক্ষপাতদুষ্ট LLM গুলি বৈষম্যমূলক সিদ্ধান্ত নিতে পারে, সামাজিক বৈষম্যকে আরও শক্তিশালী করে[1]।
- স্টেরিওটাইপের বিস্তার: সার্চ ইঞ্জিন ও চ্যাটবটে LLM-এর ব্যাপক ব্যবহার ক্ষতিকর স্টেরিওটাইপগুলির বিস্তার ও স্বাভাবিককরণের দিকে নিয়ে যেতে পারে।
- প্রযুক্তির প্রতি আস্থার ক্ষয়: ব্যবহারকারীরা যদি পদ্ধতিগত পক্ষপাতের সম্মুখীন হন, তাহলে এটি সামগ্রিকভাবে কৃত্রিম বুদ্ধিমত্তার প্রযুক্তির প্রতি তাদের আস্থাকে দুর্বল করে।
- তথ্যের বুদবুদ তৈরি: অ্যালগরিদমগুলি ফলাফল এমনভাবে তৈরি করতে পারে যাতে তা ব্যবহারকারীর অনুমানিত দৃষ্টিভঙ্গির সাথে সামঞ্জস্যপূর্ণ হয়, যা echo chambers বজায় রাখে এবং সংখ্যালঘু মতামতগুলিকে প্রান্তিক করে[1]।
পক্ষপাত শনাক্তকরণ ও হ্রাসের পদ্ধতি
বিকৃতির বিরুদ্ধে লড়াই করতে গবেষক ও ডেভেলপাররা তিনটি স্তরে একটি সমন্বিত পদ্ধতি প্রয়োগ করেন: ডেটা, মডেল এবং পোস্ট-প্রসেসিং[1]।
ডেটা স্তরে হস্তক্ষেপ
এটি সবচেয়ে মৌলিক পদ্ধতি। এতে অন্তর্ভুক্ত[1]:
- পরিষ্কার ও ভারসাম্য: প্রশিক্ষণ ডেটা থেকে বিষাক্ত ও পক্ষপাতদুষ্ট বিষয়বস্তু মুছে ফেলা।
- ডেটা বৃদ্ধি (Data Augmentation): অনুপাত সমতুল্য করতে অপর্যাপ্তভাবে উপস্থাপিত গোষ্ঠীর উদাহরণ যোগ করা।
মডেল স্তরে পরিবর্তন
এই পদ্ধতিটি প্রশিক্ষণ অ্যালগরিদম নিজেই পরিবর্তন করার লক্ষ্যে[1]:
- ন্যায্যতার সীমাবদ্ধতা: ক্ষতির ফাংশনে বিশেষ সীমাবদ্ধতা যুক্ত করা হয় যা নির্দিষ্ট ধরনের পক্ষপাত প্রদর্শনের জন্য মডেলকে "শাস্তি" দেয়।
- আর্কিটেকচার পরিবর্তন: attention প্রক্রিয়া পরিবর্তন বা পক্ষপাতদুষ্ট সংযোগগুলি পর্যবেক্ষণ ও সংশোধন করে এমন নিয়ন্ত্রণকারী মডিউল যুক্ত করার বিকল্পগুলি গবেষণা করা হচ্ছে।
ফলাফলের পোস্ট-প্রসেসিং
এই পদ্ধতিটি উত্তর তৈরির পর্যায়ে প্রয়োগ করা হয়[1]:
- ফিল্টারিং ও সংশোধন: বিশেষ অ্যালগরিদম তৈরিকৃত পাঠ্য বিশ্লেষণ করে এবং সম্ভাব্য বৈষম্যমূলক শব্দগুলিকে নরম করে বা মুছে দেয়।
- মানব পুরস্কার থেকে Reinforcement Learning (RLHF): মানুষের দেওয়া মূল্যায়নের উপর ভিত্তি করে মডেলটিকে বিশেষভাবে আরও নিরপেক্ষ ও নিরাপদ উত্তর দেওয়ার জন্য fine-tuning করা হয়।
উল্লেখযোগ্য অগ্রগতি সত্ত্বেও, LLM থেকে পক্ষপাত সম্পূর্ণভাবে দূর করা এখনো সম্ভব হয়নি। এটি আরও ন্যায্য ও নির্ভরযোগ্য AI সিস্টেম তৈরির লক্ষ্যে গবেষণার অন্যতম মূল ক্ষেত্র হিসাবে রয়ে গেছে[4]।
তথ্যসূত্র
- Generative language models exhibit social identity biases — Nature Computational Science-এ গবেষণা
- Unpacking the bias of large language models — MIT News-এর নিবন্ধ
সাহিত্য
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
- Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
- Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [৭].
- Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
- Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.
টীকা
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [১]
- ↑ 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [২]
- ↑ «Large Language Models». Энциклопедия BigdataSchool. [৩]
- ↑ 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [৪]
- ↑ «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
- ↑ «Unpacking the bias of large language models». MIT News. [৫]
- ↑ 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [৬]