Bias in large language models — انحراف و تعصب در LLM
تعصب در مدلهای زبانی بزرگ (انگلیسی: bias in large language models) — انحرافات سیستماتیک در عملکرد مدلهای زبانی بزرگ (LLM) هستند که به تولید پاسخهایی منجر میشوند که واقعیت را بهصورت ناعادلانه یا نادرست بازتاب میدهند و کلیشههای موجود در جامعه را بازتولید و تقویت میکنند[1]. برخلاف خطاهای تصادفی، تعصب ماهیتی قانونمند دارد و ناشی از ویژگیهای دادههای آموزشی و الگوریتمهاست. LLMها میتوانند کلیشههای جنسیتی، قومی و سایر کلیشهها را بازتولید کنند، که این امر بهویژه در حوزههای حساس مانند پزشکی، حقوق و امور مالی مشکل جدیای محسوب میشود[2].
منابع تعصب
تعصب در LLMها از دو منبع اصلی سرچشمه میگیرد: دادههای دارای انحراف و ویژگیهای خود الگوریتمها.
دادههای آموزشی دارای انحراف
علت اصلی پیدایش تعصب، دادههای آموزشی هستند که انحرافات تاریخی، اجتماعی و فرهنگی موجود در جهان را بازتاب میدهند. LLMها بر روی مجموعههای متنی عظیمی از اینترنت، کتابها و سایر منابع انسانی آموزش میبینند و در نتیجه تمام کلیشههای موجود در آنها را به ارث میبرند[3].
- نمایندگی نامتوازن: اگر گروههای جمعیتی خاصی (مانند اقلیتهای قومی، زنان در مشاغل معین) بهاندازه کافی در دادهها نمایندگی نشده باشند، مدل تصویر تحریفشدهای از آنها شکل میدهد. بهعنوان نمونه، LLMها اغلب واژه «پزشک» را با جنس مذکر و «پرستار» را با جنس مؤنث مرتبط میکنند و کلیشههای جنسیتی تاریخی را بازتولید میکنند[1].
- انحرافات تاریخی و فرهنگی: دادهها اغلب دیدگاههای فرهنگی غالب و پیشداوریهای تاریخی را منعکس میکنند. مدلی که بر چنین متونهایی آموزش دیده باشد، این دیدگاهها را بازتولید میکند و دیدگاههای جایگزین را نادیده میگیرد[4].
تقویت الگوریتمی
معماری و الگوریتم آموزشی LLMها نهتنها میتوانند انحرافات موجود در دادهها را بازتولید کنند، بلکه آنها را تقویت نیز میکنند. اکثر LLMهای مدرن مبتنی بر transformer هستند و کلمه بعدی را بر اساس الگوهای آماری پیشبینی میکنند. این امر موجب میشود مدل به سمت متداولترین الگوها گرایش پیدا کند، که این نظرات و کلیشههای غالب را تثبیت و تقویت میکند، در حالی که موارد نادر و غیرمعمول نادیده گرفته میشوند[2]. این مکانیزم میتواند یک انحراف جزئی در دادهها را به تعصبی آشکار در پاسخهای مدل تبدیل کند[1].
انواع تعصبات و نمونهها
تعصبات اجتماعی و جمعیتی
این شناختهشدهترین نوع تعصب است که شامل کلیشههای مرتبط با جنسیت، نژاد، سن، دین و سایر ویژگیهای اجتماعی میشود.
- کلیشههای جنسیتی: LLMها اغلب مشاغل و ویژگیهای خاص را با جنسیت معینی مرتبط میکنند. برای مثال، در پاسخ به درخواستی درباره «رهبر قدرتمند»، مدل با احتمال بیشتری توصیف یک مرد را تولید میکند.
- کلیشههای نژادی و قومی: مدلها میتوانند کلیشههای منفی درباره گروههای قومی مختلف بازتولید کنند. پژوهشها نشان دادهاند که الگوریتمهای اعتدال مبتنی بر LLM ممکن است پیامهایی به گویش عامیانه آفریقایی-آمریکایی (AAVE) را سختگیرانهتر ارزیابی کنند و بهاشتباه آنها را توهینآمیزتر بدانند[5].
- تعصب گروهی («خودی در برابر بیگانه»): پژوهشی در سال ۲۰۲۴ نشان داد که LLMها تعصب گروهی آشکاری از خود نشان میدهند. هنگامی که به مدل یک prompt داده میشود که آن را با گروه خاصی مرتبط کند («ما...»)، مدل تمایل دارد نظر مثبتی درباره آن گروه و نظر تحقیرآمیزی درباره «بیگانگان» ابراز کند[4].
تحریفات ساختاری و شناختی
این تحریفات به ویژگیهای معماری و پردازش اطلاعات مربوط میشوند.
- انحراف موقعیتی: پژوهشی از مؤسسه فناوری ماساچوست (MIT) نشان داد که مدلها اطلاعات ابتدا و انتهای سند را بهطور نامتناسبی در نظر میگیرند و اغلب جزئیات میانه را «از دست میدهند». این میتواند بر دقت هنگام کار با متنهای طولانی تأثیر بگذارد[6].
- گرایش به میانگینگیری: از آنجا که LLMها مدلهای احتمالاتی هستند، تمایل دارند متداولترین (میانگین) پاسخها را تولید کنند، که منجر به نادیده گرفتن حقایق، استثناها و نظرات اقلیتهای نادر اما مهم میشود[2].
- اثر تأیید: LLMها ممکن است تمایلی به بازتولید الگوهای منطقی موجود در دادههای آموزشی نشان دهند، حتی اگر حاوی تعصب باشند، و اطلاعات متناقض با آنها را نادیده بگیرند[2].
نمونهای از عملکرد واقعی
پژوهشی از بانک جهانی نشان داد که در تحلیل مصاحبههای پناهندگان، LLM بهطور سیستماتیک معنای اظهارات آنها را بسته به منشأ و جنسیتشان تحریف میکرد. مدل تلاش والدین پناهنده برای موفقیت فرزندانشان را بهاشتباه تفسیر میکرد، احتمالاً به دلیل فقدان چنین روایتهایی در دادههای آموزشی که عمدتاً از متون «نویسندگان سفیدپوست طبقه متوسط» تشکیل شده بود[7][7].
خطرات و پیامدها
- تشدید تبعیض: در حوزههایی مانند استخدام، اعطای اعتبار و حقوق، LLMهای دارای تعصب میتوانند تصمیمات تبعیضآمیز اتخاذ کنند و نابرابری اجتماعی را تقویت کنند[1].
- گسترش کلیشهها: استفاده گسترده از LLMها در موتورهای جستجو و چتباتها میتواند به تکثیر و عادیسازی کلیشههای مضر منجر شود.
- تضعیف اعتماد به فناوری: اگر کاربران با تعصب سیستماتیک مواجه شوند، اعتمادشان به فناوریهای هوش مصنوعی بهطور کلی کاهش مییابد.
- ایجاد حبابهای اطلاعاتی: الگوریتمها میتوانند خروجی را بهگونهای شکل دهند که با دیدگاههای مفروض کاربر مطابقت داشته باشد، که این امر echo chambers را حفظ میکند و نظرات اقلیتها را به حاشیه میراند[1].
روشهای شناسایی و کاهش تعصب
برای مقابله با تحریفات، پژوهشگران و توسعهدهندگان رویکردی جامع در سه سطح بهکار میگیرند: داده، مدل و پسپردازش[1].
مداخلات در سطح داده
این بنیادیترین رویکرد است. شامل موارد زیر میشود[1]:
- پاکسازی و متوازنسازی: حذف محتوای سمی و دارای تعصب از دادههای آموزشی.
- افزایش داده (Data Augmentation): افزودن نمونههایی از گروههای کمنمایندگی برای برقراری تعادل در نسبتها.
اصلاح در سطح مدل
این رویکرد به تغییر خود الگوریتم آموزشی میپردازد[1]:
- محدودیتهای انصاف: محدودیتهای ویژهای در تابع زیان معرفی میشوند که مدل را برای نشان دادن انواع خاصی از تعصب «جریمه» میکنند.
- تغییر معماری: گزینههایی برای تغییر مکانیزمهای attention یا افزودن ماژولهای کنترلی بررسی میشود که تداعیهای دارای تعصب را ردیابی و اصلاح میکنند.
پسپردازش نتایج
این روش در مرحله تولید پاسخها اعمال میشود[1]:
- فیلترکردن و اصلاح: الگوریتمهای ویژه متن تولیدشده را تحلیل میکنند و عبارات بالقوه تبعیضآمیز را تلطیف یا حذف میکنند.
- fine-tuning با تقویت از انسان (RLHF): مدل بهطور ویژه برای ارائه پاسخهای خنثیتر و ایمنتر بر اساس ارزیابیهای انسانی دوباره آموزش میبیند.
علیرغم پیشرفتهای قابلتوجه، تاکنون موفقیت کامل در رهایی LLMها از تعصب حاصل نشده است. این موضوع همچنان یکی از حوزههای کلیدی پژوهش در راستای ایجاد سیستمهای هوش مصنوعی عادلانهتر و قابلاعتمادتر باقی میماند[4].
پیوندها
- Generative language models exhibit social identity biases — پژوهشی در Nature Computational Science
- Unpacking the bias of large language models — مقالهای از MIT News
منابع
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
- Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
- Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [۷].
- Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
- Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [۱]
- ↑ 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [۲]
- ↑ «Large Language Models». Энциклопедия BigdataSchool. [۳]
- ↑ 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [۴]
- ↑ «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
- ↑ «Unpacking the bias of large language models». MIT News. [۵]
- ↑ 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [۶]