Biais de génération

From Systems analysis wiki
Jump to navigation Jump to search

Le biais dans les grands modèles de langage (LLM) est une distorsion systématique des textes générés, par laquelle le modèle reflète ou amplifie les stéréotypes et préjugés existant dans la société, liés au genre, à la race, à la culture, aux opinions politiques et à d'autres catégories sociales. Ce phénomène survient car les LLM sont entraînés sur d'immenses corpus de données humaines, qui contiennent inévitablement des informations biaisées[1].

Le biais constitue l'un des problèmes éthiques et techniques majeurs dans le développement de l'IA, car il peut entraîner des discriminations, la diffusion de désinformation et saper la confiance dans ces technologies.

Types de biais dans les LLM

Le biais dans les LLM peut se manifester sous diverses formes.

Biais de genre

Les modèles ont tendance à reproduire les stéréotypes de genre traditionnels, en associant des professions et des caractéristiques à un sexe particulier.

  • Une étude de l'UNESCO de 2024 a montré que les LLM sont quatre fois plus susceptibles de décrire les femmes dans des rôles domestiques (« maison », « famille », « enfants ») que les hommes, tandis que les hommes sont associés aux concepts de « business » et de « carrière »[2].
  • Une étude publiée dans Nature Scientific Reports a révélé un biais de genre et de race significatif dans le contenu généré par sept grands LLM, dont ChatGPT et LLaMA[3].
  • Dans le contexte russophone, les modèles utilisent souvent par défaut le genre masculin pour des rôles neutres (par exemple, « médecin », « directeur ») et peinent à générer des féminitifs[4].

Biais racial et ethnique

Les LLM peuvent manifester une discrimination latente à l'égard de divers groupes ethniques.

  • Une étude de Bloomberg a montré que ChatGPT 3.5 préférait les CV de candidats d'origine asiatique par rapport aux candidats noirs[5].
  • Dans le contexte russophone, le dataset RuBia a révélé que les modèles peuvent reproduire des stéréotypes antisémites et anti-immigrés (par exemple, en validant l'affirmation « les immigrés sont paresseux ») s'ils sont présents dans le corpus d'entraînement[6].

Biais politique et idéologique

Malgré les affirmations de neutralité, de nombreux LLM manifestent une tendance envers un certain spectre politique.

  • Une étude du Centre for Policy Studies a révélé un biais de gauche-libéral chez 23 des 24 LLM testés[7].
  • Des tests menés par l'Université de Washington et l'Université Carnegie-Mellon ont montré que ChatGPT et GPT-4 étaient les plus orientés à gauche-libertaire, tandis que LLaMA de Meta était le plus orienté à droite-autoritaire[8].

Mécanismes d'apparition du biais

  • Données d'entraînement : La source principale. Les LLM sont entraînés sur d'immenses corpus de textes provenant d'Internet, qui sont le « miroir » de la société avec tous ses stéréotypes[9].
  • Architecture et algorithmes d'entraînement : L'architecture même des transformeurs peut renforcer les corrélations existantes dans les données.
  • Ajustement fin (fine-tuning) et RLHF : L'étape d'apprentissage par renforcement à partir de la rétroaction humaine (RLHF) peut également introduire des biais, car les évaluateurs humains sont inévitablement guidés par leurs propres opinions.

Méthodes de détection et d'atténuation

Détection du biais

  • Ensembles de tests de stéréotypes : Des datasets spécialisés sont utilisés, tels que :
    • CrowS-Pairs : Couvre neuf types de biais, y compris la race, la religion et l'âge[10].
    • StereoSet : Mesure le biais stéréotypique dans quatre domaines : genre, profession, race et religion[11].
    • RuBia : Un dataset spécialisé pour la détection des biais dans les modèles russophones[12].
    • Ressources multilingues : Des adaptations telles que French CrowS-Pairs[13] et le Chinese Bias Benchmark (CBBQ)[14].
    • Analyse dans des domaines spécifiques : Études sur les biais dans le recrutement[15], la médecine[16] et d'autres secteurs.

Atténuation du biais

  • Au niveau des données (Pre-processing) : Nettoyage, filtrage et rééquilibrage des corpus d'entraînement. Les méthodes sont décrites dans la documentation de Holistic AI[17].
  • Au niveau de l'entraînement (In-processing) : Modification des algorithmes d'entraînement pour prendre en compte l'équité (fairness).
  • Au niveau de la sortie (Post-processing) : Filtrage et modération des réponses déjà générées.

Conséquences juridiques et éthiques

Le biais dans l'IA a de graves conséquences, notamment la discrimination dans des domaines critiques et la diffusion de désinformation.

  • Réglementation : Les gouvernements du monde entier commencent à introduire des normes pour contrôler l'IA.
  • En Europe, l' AI Act a été adopté et entre en vigueur progressivement à partir du 1er août 2024. Il impose des exigences strictes pour les systèmes à haut risque, y compris une évaluation obligatoire des biais, et prévoit des amendes pouvant aller jusqu'à 7 % du chiffre d'affaires mondial de l'entreprise[18].
  • En Russie, en 2021, les principales entreprises technologiques ont signé un Code d'éthique volontaire dans le domaine de l'IA, s'engageant à minimiser la discrimination. Fin 2021, plus de 100 organisations l'avaient signé[19].

La lutte contre les biais est un compromis permanent. Un filtrage trop agressif peut conduire à un « excès de politiquement correct », où le modèle refuse d'aborder des sujets sensibles. Par conséquent, les développeurs recherchent un équilibre entre la sécurité, l'objectivité et la pertinence informative du modèle.

Voir aussi

Bibliographie

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI’s GPT-3. arXiv:2306.02428.

Références

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. « Biais des LLM russophones : qui la machine considère-t-elle comme une “personne ordinaire” ? ». Habr. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. « Modèles de langage : comment surmonter les biais et garantir la sécurité ». RBC Trends. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]