Bias in large language models — انحراف و تعصب در LLM

From Systems analysis wiki
Jump to navigation Jump to search

تعصب در مدل‌های زبانی بزرگ (انگلیسی: bias in large language models) — انحرافات سیستماتیک در عملکرد مدل‌های زبانی بزرگ (LLM) هستند که به تولید پاسخ‌هایی منجر می‌شوند که واقعیت را به‌صورت ناعادلانه یا نادرست بازتاب می‌دهند و کلیشه‌های موجود در جامعه را بازتولید و تقویت می‌کنند[1]. برخلاف خطاهای تصادفی، تعصب ماهیتی قانونمند دارد و ناشی از ویژگی‌های داده‌های آموزشی و الگوریتم‌هاست. LLMها می‌توانند کلیشه‌های جنسیتی، قومی و سایر کلیشه‌ها را بازتولید کنند، که این امر به‌ویژه در حوزه‌های حساس مانند پزشکی، حقوق و امور مالی مشکل جدی‌ای محسوب می‌شود[2].

منابع تعصب

تعصب در LLMها از دو منبع اصلی سرچشمه می‌گیرد: داده‌های دارای انحراف و ویژگی‌های خود الگوریتم‌ها.

داده‌های آموزشی دارای انحراف

علت اصلی پیدایش تعصب، داده‌های آموزشی هستند که انحرافات تاریخی، اجتماعی و فرهنگی موجود در جهان را بازتاب می‌دهند. LLMها بر روی مجموعه‌های متنی عظیمی از اینترنت، کتاب‌ها و سایر منابع انسانی آموزش می‌بینند و در نتیجه تمام کلیشه‌های موجود در آن‌ها را به ارث می‌برند[3].

  • نمایندگی نامتوازن: اگر گروه‌های جمعیتی خاصی (مانند اقلیت‌های قومی، زنان در مشاغل معین) به‌اندازه کافی در داده‌ها نمایندگی نشده باشند، مدل تصویر تحریف‌شده‌ای از آن‌ها شکل می‌دهد. به‌عنوان نمونه، LLMها اغلب واژه «پزشک» را با جنس مذکر و «پرستار» را با جنس مؤنث مرتبط می‌کنند و کلیشه‌های جنسیتی تاریخی را بازتولید می‌کنند[1].
  • انحرافات تاریخی و فرهنگی: داده‌ها اغلب دیدگاه‌های فرهنگی غالب و پیش‌داوری‌های تاریخی را منعکس می‌کنند. مدلی که بر چنین متون‌هایی آموزش دیده باشد، این دیدگاه‌ها را بازتولید می‌کند و دیدگاه‌های جایگزین را نادیده می‌گیرد[4].

تقویت الگوریتمی

معماری و الگوریتم آموزشی LLMها نه‌تنها می‌توانند انحرافات موجود در داده‌ها را بازتولید کنند، بلکه آن‌ها را تقویت نیز می‌کنند. اکثر LLMهای مدرن مبتنی بر transformer هستند و کلمه بعدی را بر اساس الگوهای آماری پیش‌بینی می‌کنند. این امر موجب می‌شود مدل به سمت متداول‌ترین الگوها گرایش پیدا کند، که این نظرات و کلیشه‌های غالب را تثبیت و تقویت می‌کند، در حالی که موارد نادر و غیرمعمول نادیده گرفته می‌شوند[2]. این مکانیزم می‌تواند یک انحراف جزئی در داده‌ها را به تعصبی آشکار در پاسخ‌های مدل تبدیل کند[1].

انواع تعصبات و نمونه‌ها

تعصبات اجتماعی و جمعیتی

این شناخته‌شده‌ترین نوع تعصب است که شامل کلیشه‌های مرتبط با جنسیت، نژاد، سن، دین و سایر ویژگی‌های اجتماعی می‌شود.

  • کلیشه‌های جنسیتی: LLMها اغلب مشاغل و ویژگی‌های خاص را با جنسیت معینی مرتبط می‌کنند. برای مثال، در پاسخ به درخواستی درباره «رهبر قدرتمند»، مدل با احتمال بیشتری توصیف یک مرد را تولید می‌کند.
  • کلیشه‌های نژادی و قومی: مدل‌ها می‌توانند کلیشه‌های منفی درباره گروه‌های قومی مختلف بازتولید کنند. پژوهش‌ها نشان داده‌اند که الگوریتم‌های اعتدال مبتنی بر LLM ممکن است پیام‌هایی به گویش عامیانه آفریقایی-آمریکایی (AAVE) را سخت‌گیرانه‌تر ارزیابی کنند و به‌اشتباه آن‌ها را توهین‌آمیزتر بدانند[5].
  • تعصب گروهی («خودی در برابر بیگانه»): پژوهشی در سال ۲۰۲۴ نشان داد که LLMها تعصب گروهی آشکاری از خود نشان می‌دهند. هنگامی که به مدل یک prompt داده می‌شود که آن را با گروه خاصی مرتبط کند («ما...»)، مدل تمایل دارد نظر مثبتی درباره آن گروه و نظر تحقیرآمیزی درباره «بیگانگان» ابراز کند[4].

تحریفات ساختاری و شناختی

این تحریفات به ویژگی‌های معماری و پردازش اطلاعات مربوط می‌شوند.

  • انحراف موقعیتی: پژوهشی از مؤسسه فناوری ماساچوست (MIT) نشان داد که مدل‌ها اطلاعات ابتدا و انتهای سند را به‌طور نامتناسبی در نظر می‌گیرند و اغلب جزئیات میانه را «از دست می‌دهند». این می‌تواند بر دقت هنگام کار با متن‌های طولانی تأثیر بگذارد[6].
  • گرایش به میانگین‌گیری: از آنجا که LLMها مدل‌های احتمالاتی هستند، تمایل دارند متداول‌ترین (میانگین) پاسخ‌ها را تولید کنند، که منجر به نادیده گرفتن حقایق، استثناها و نظرات اقلیت‌های نادر اما مهم می‌شود[2].
  • اثر تأیید: LLMها ممکن است تمایلی به بازتولید الگوهای منطقی موجود در داده‌های آموزشی نشان دهند، حتی اگر حاوی تعصب باشند، و اطلاعات متناقض با آن‌ها را نادیده بگیرند[2].

نمونه‌ای از عملکرد واقعی

پژوهشی از بانک جهانی نشان داد که در تحلیل مصاحبه‌های پناهندگان، LLM به‌طور سیستماتیک معنای اظهارات آن‌ها را بسته به منشأ و جنسیتشان تحریف می‌کرد. مدل تلاش والدین پناهنده برای موفقیت فرزندانشان را به‌اشتباه تفسیر می‌کرد، احتمالاً به دلیل فقدان چنین روایت‌هایی در داده‌های آموزشی که عمدتاً از متون «نویسندگان سفیدپوست طبقه متوسط» تشکیل شده بود[7][7].

خطرات و پیامدها

  • تشدید تبعیض: در حوزه‌هایی مانند استخدام، اعطای اعتبار و حقوق، LLMهای دارای تعصب می‌توانند تصمیمات تبعیض‌آمیز اتخاذ کنند و نابرابری اجتماعی را تقویت کنند[1].
  • گسترش کلیشه‌ها: استفاده گسترده از LLMها در موتورهای جستجو و چت‌بات‌ها می‌تواند به تکثیر و عادی‌سازی کلیشه‌های مضر منجر شود.
  • تضعیف اعتماد به فناوری: اگر کاربران با تعصب سیستماتیک مواجه شوند، اعتمادشان به فناوری‌های هوش مصنوعی به‌طور کلی کاهش می‌یابد.
  • ایجاد حباب‌های اطلاعاتی: الگوریتم‌ها می‌توانند خروجی را به‌گونه‌ای شکل دهند که با دیدگاه‌های مفروض کاربر مطابقت داشته باشد، که این امر echo chambers را حفظ می‌کند و نظرات اقلیت‌ها را به حاشیه می‌راند[1].

روش‌های شناسایی و کاهش تعصب

برای مقابله با تحریفات، پژوهشگران و توسعه‌دهندگان رویکردی جامع در سه سطح به‌کار می‌گیرند: داده، مدل و پس‌پردازش[1].

مداخلات در سطح داده

این بنیادی‌ترین رویکرد است. شامل موارد زیر می‌شود[1]:

  • پاک‌سازی و متوازن‌سازی: حذف محتوای سمی و دارای تعصب از داده‌های آموزشی.
  • افزایش داده (Data Augmentation): افزودن نمونه‌هایی از گروه‌های کم‌نمایندگی برای برقراری تعادل در نسبت‌ها.

اصلاح در سطح مدل

این رویکرد به تغییر خود الگوریتم آموزشی می‌پردازد[1]:

  • محدودیت‌های انصاف: محدودیت‌های ویژه‌ای در تابع زیان معرفی می‌شوند که مدل را برای نشان دادن انواع خاصی از تعصب «جریمه» می‌کنند.
  • تغییر معماری: گزینه‌هایی برای تغییر مکانیزم‌های attention یا افزودن ماژول‌های کنترلی بررسی می‌شود که تداعی‌های دارای تعصب را ردیابی و اصلاح می‌کنند.

پس‌پردازش نتایج

این روش در مرحله تولید پاسخ‌ها اعمال می‌شود[1]:

  • فیلترکردن و اصلاح: الگوریتم‌های ویژه متن تولیدشده را تحلیل می‌کنند و عبارات بالقوه تبعیض‌آمیز را تلطیف یا حذف می‌کنند.
  • fine-tuning با تقویت از انسان (RLHF): مدل به‌طور ویژه برای ارائه پاسخ‌های خنثی‌تر و ایمن‌تر بر اساس ارزیابی‌های انسانی دوباره آموزش می‌بیند.

علی‌رغم پیشرفت‌های قابل‌توجه، تاکنون موفقیت کامل در رهایی LLMها از تعصب حاصل نشده است. این موضوع همچنان یکی از حوزه‌های کلیدی پژوهش در راستای ایجاد سیستم‌های هوش مصنوعی عادلانه‌تر و قابل‌اعتمادتر باقی می‌ماند[4].

پیوندها

  • Generative language models exhibit social identity biases — پژوهشی در Nature Computational Science
  • Unpacking the bias of large language models — مقاله‌ای از MIT News

منابع

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
  • Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
  • Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [۷].
  • Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
  • Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [۱]
  2. 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [۲]
  3. «Large Language Models». Энциклопедия BigdataSchool. [۳]
  4. 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [۴]
  5. «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
  6. «Unpacking the bias of large language models». MIT News. [۵]
  7. 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [۶]