Изкривявания на данните и bias

From Systems analysis wiki
Jump to navigation Jump to search

Предубеденост в големите езикови модели (англ. bias in large language models) — това са систематични отклонения в работата на големите езикови модели (LLM), водещи до генериране на отговори, които несправедливо или неточно отразяват действителността, възпроизвеждат и усилват съществуващите в обществото стереотипи[1]. За разлика от случайните грешки, предубедеността има закономерен характер и се обуславя от особеностите на обучаващите данни и алгоритмите. LLM могат да възпроизвеждат полови, етнически и други стереотипи, което представлява сериозен проблем, особено в отговорни области като медицина, юриспруденция и финанси[2].

Източници на предубеденост

Предубедеността в LLM възниква от два основни източника: изкривени данни и особености на самите алгоритми.

Изкривени обучаващи данни

Основната причина за появата на предубеденост са обучаващите данни, които отразяват исторически, социални и културни изкривявания, съществуващи в света. LLM се обучават върху огромни корпуси от текстове от интернет, книги и други източници, създадени от хора, и като следствие наследяват всички съдържащи се в тях стереотипи[3].

  • Небалансирано представяне: Ако в данните определени демографски групи са недостатъчно представени (например етнически малцинства, жени в определени професии), моделът формира изкривено представа за тях. Например LLM често асоциират думата „лекар" с мъжки пол, а „медицинска сестра" — с женски, възпроизвеждайки исторически полови стереотипи[1].
  • Исторически и културни изкривявания: Данните често отразяват доминиращи културни възгледи и исторически предразсъдъци. Моделът, обучен върху такива текстове, ще възпроизвежда тези възгледи, игнорирайки алтернативни перспективи[4].

Алгоритмично усилване

Архитектурата и алгоритъмът за обучение на LLM могат не само да възпроизвеждат, но и да усилват съществуващите в данните отклонения. Повечето съвременни LLM се основават на transformer архитектура и предсказват следващата дума въз основа на статистически закономерности. Това води до това, че моделът се накланя към най-често срещаните patterns, което затвърждава и усилва доминиращите мнения и стереотипи, докато редките и нетипични случаи се игнорират[2]. Този механизъм може да превърне незначително отклонение в данните в ярко изразена предубеденост в отговорите на модела[1].

Видове предубеждения и примери

Социални и демографски предубеждения

Това е най-изученият тип предубеденост, който включва стереотипи, свързани с пол, раса, възраст, религия и други социални характеристики.

  • Полови стереотипи: LLM често свързват определени професии и качества с конкретен пол. Например при запитване за „силен лидер" моделът с по-голяма вероятност ще генерира описание на мъж.
  • Расови и етнически стереотипи: Моделите могат да възпроизвеждат негативни стереотипи за различни етнически групи. Изследвания показаха, че алгоритмите за модерация на базата на LLM могат да оценяват по-строго съобщения на афроамерикански разговорен език (AAVE), погрешно считайки ги за по-обидни[5].
  • Групова предубеденост („свои срещу чужди"): Изследване от 2024 г. показа, че LLM проявяват ярко изразена групова предубеденост. Получавайки подсказка, асоциираща я с определена група („Ние..."), моделът е склонен да се изказва благосклонно за тази група и пренебрежително — за „чуждите"[4].

Структурни и когнитивни изкривявания

Тези изкривявания са свързани с особеностите на архитектурата и обработката на информацията.

  • Позиционно отклонение: Изследване на Масачузетския технологичен институт (MIT) установи, че моделите непропорционално силно отчитат информацията от началото и края на документа, като често „пропускат" детайли от средата. Това може да влияе върху точността при работа с дълги текстове[6].
  • Склонност към усредняване: Бидейки вероятностни модели, LLM се стремят да генерират най-честите (усреднени) отговори, което води до игнориране на редки, но важни факти, изключения и мнения на малцинствата[2].
  • Ефект на потвърждението: LLM могат да демонстрират склонност да възпроизвеждат логически шаблони, присъстващи в обучаващите данни, дори ако те съдържат предразсъдъци, и да игнорират противоречащи им сведения[2].

Пример от практиката

Изследване на Световната банка установи, че при анализ на интервюта с бежанци LLM систематично изкривява смисъла на техните изказвания в зависимост от произхода и пола. Моделът неправилно интерпретира стремежа на родителите-бежанци към успеха на децата им, вероятно поради липсата на подобни разкази в обучаващите данни, състоящи се предимно от текстове на „бели автори от средната класа"[7][7].

Рискове и последствия

  • Усилване на дискриминацията: В области като наемане на работа, кредитиране и юриспруденция предубедените LLM могат да вземат дискриминационни решения, усилвайки социалното неравенство[1].
  • Разпространение на стереотипи: Масовото използване на LLM в търсачки и чатботове може да доведе до тиражиране и нормализиране на вредни стереотипи.
  • Подронване на доверието в технологиите: Когато потребителите се сблъскват със систематична предубеденост, това подрива доверието им в технологиите на изкуствения интелект като цяло.
  • Създаване на информационни балони: Алгоритмите могат да формират резултатите така, че да съответстват на предполагаемите възгледи на потребителя, което поддържа echo chambers и маргинализира мненията на малцинствата[1].

Методи за установяване и намаляване на предубедеността

За борба с изкривяванията изследователите и разработчиците прилагат комплексен подход, работейки на три нива: данни, модел и постобработка[1].

Интервенции на ниво данни

Това е най-фундаменталният подход. Той включва[1]:

  • Почистване и балансиране: Премахване на токсично и предубедено съдържание от обучаващите данни.
  • Аугментация на данни (Data Augmentation): Добавяне на примери с недостатъчно представени групи за изравняване на пропорциите.

Модификация на ниво модел

Този подход е насочен към промяна на самия алгоритъм за обучение[1]:

  • Ограничения за справедливост: Във функцията на загубата се въвеждат специални ограничения, които „наказват" модела за проявяване на определени видове предубеденост.
  • Промяна на архитектурата: Изследват се варианти за промяна на механизмите на attention или добавяне на контролиращи модули, които следят и коригират предубедените асоциации.

Постобработка на резултатите

Този метод се прилага на етапа на генериране на отговори[1]:

  • Филтриране и коригиране: Специални алгоритми анализират генерирания текст и смекчават или премахват потенциално дискриминационни формулировки.
  • Допълнително обучение с подкрепление от човек (RLHF): Моделът се обучава допълнително да дава по-неутрални и безопасни отговори въз основа на оценки, предоставени от хора.

Въпреки значителния напредък, засега не е постигнато пълно освобождаване на LLM от предубеденост. Това остава една от ключовите области на изследванията, насочени към създаване на по-справедливи и надеждни системи с изкуствен интелект[4].

Препратки

  • Generative language models exhibit social identity biases — изследване в Nature Computational Science
  • Unpacking the bias of large language models — статия от MIT News

Литература

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
  • Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
  • Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [7].
  • Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
  • Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.

Бележки

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [2]
  3. «Large Language Models». Энциклопедия BigdataSchool. [3]
  4. 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [4]
  5. «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
  6. «Unpacking the bias of large language models». MIT News. [5]
  7. 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [6]