Perroquet stochastique
Perroquet stochastique (en anglais Stochastic parrot) est une métaphore utilisée dans le domaine de l'intelligence artificielle pour décrire les grands modèles de langage (LLM) comme des systèmes capables de combiner des formes linguistiques de manière statistiquement plausible, mais dépourvus de toute compréhension réelle de leur sens[1].
Le terme a été introduit en mars 2021 dans l'article de recherche On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? (« Sur les dangers des perroquets stochastiques : les modèles de langage peuvent-ils être trop grands ? »), publié lors de la conférence FAccT. Les auteurs en sont Emily M. Bender, Timnit Gebru, Angelina McMillan-Major et Margaret Mitchell[2].
Définition et concept
Selon les auteurs de l'article, un perroquet stochastique est un « système permettant d'assembler de manière désordonnée des séquences de formes linguistiques observées dans ses vastes données d'entraînement, en se basant sur des informations probabilistes sur la manière dont elles se combinent, mais sans aucun lien avec le sens »[2].
Le terme se compose de deux parties :
- Stochastique — du grec ancien στοχαστικός (« basé sur la conjecture »), désigne en mathématiques modernes un processus déterminé par une distribution de probabilité aléatoire[1].
- Perroquet — en référence à la capacité des perroquets à imiter la parole humaine sans en comprendre le sens[1].
Le concept soutient que les LLM, entraînés à prédire le mot suivant dans une séquence, sont essentiellement des systèmes d'autocomplétion complexes qui manipulent des symboles sans avoir accès à leur signification.
Principaux arguments de l'article « On the Dangers of Stochastic Parrots »
L'article met en évidence quatre grandes catégories de risques liés au développement de modèles de langage excessivement grands.
1. Des données d'entraînement insondables
Les LLM sont entraînés sur d'immenses ensembles de données non annotées, collectées sur Internet (par exemple, Common Crawl). De tels datasets contiennent inévitablement des biais, un langage toxique et des points de vue hégémoniques qui portent préjudice aux groupes vulnérables. Par exemple, le contenu d'Internet représente de manière disproportionnée les hommes blancs des pays développés (67 % des utilisateurs de Reddit aux États-Unis sont des hommes)[2].
2. Absence de compréhension réelle du langage
Les auteurs affirment que les LLM n'ont pas de véritable compréhension du langage. Ils se réfèrent à la théorie selon laquelle le langage est un système de signes où la forme (le mot) est indissociablement liée à la signification (le sens). Les données d'entraînement des LLM ne contiennent que la forme, privant ainsi le modèle de l'accès à la signification. Par conséquent, les LLM ne font qu'imiter un discours sensé.
3. Texte synthétique et préjudices potentiels
Comme les LLM génèrent un texte grammaticalement correct et convaincant, les gens ont tendance à lui attribuer un sens et à lui faire confiance. Cela crée un risque de propagation de la désinformation, des discours de haine et des escroqueries. Plus l'imitation est parfaite, plus le risque est grand que les gens surestiment les capacités de l'IA et lui confient des décisions critiques.
Impact scientifique et controverse autour de la publication
L'article a été au centre d'un scandale majeur chez Google, où travaillaient à l'époque les co-auteures Timnit Gebru et Margaret Mitchell. Fin 2020, lors de l'examen interne, la direction de Google a exigé que les auteurs retirent l'article ou en suppriment les noms des employés de Google[3].
Timnit Gebru, une chercheuse de premier plan en éthique de l'IA, a refusé d'obtempérer, ce qui a conduit à son licenciement de Google en décembre 2020. En février 2021, Margaret Mitchell, qui avait pris la défense de Gebru, a également été licenciée[4]. Ces événements ont provoqué un large tollé. Plus de 2 200 employés de Google et des milliers de membres de la communauté universitaire ont signé une lettre de protestation, accusant l'entreprise de censure scientifique et de museler la recherche qui pourrait nuire à ses intérêts commerciaux[5]. Finalement, l'article a été publié en mars 2021 lors de la conférence FAccT.
Réactions, débats et évolution des perspectives
La métaphore du « perroquet stochastique » s'est rapidement répandue et est devenue un point central dans les débats sur la nature de l'intelligence artificielle. L'American Dialect Society (ADS) a élu «stochastic parrot» mot de l'année 2023 dans le domaine de l'IA, devançant même « ChatGPT » et « LLM »[1].
Critique du concept et preuves de compréhension
Le concept a été contesté par de nombreux chercheurs de premier plan.
- Geoffrey Hinton, l'un des « parrains » de l'apprentissage profond, a affirmé que « pour prédire avec précision le mot suivant, il faut comprendre la phrase »[1]. En 2023, après avoir quitté Google, il a déclaré que les grands modèles « comprennent » déjà ce qu'on leur apprend et peuvent tirer leurs propres conclusions[6].
- Capacités émergentes: Des recherches ont montré qu'en atteignant une certaine échelle, les LLM manifestent l'apparition soudaine de nouvelles capacités, comme la résolution de problèmes arithmétiques, qui n'y avaient pas été explicitement intégrées[7].
- Modèles internes du monde: Une étude de 2022 a révélé qu'un modèle entraîné à jouer à Othello à partir de transcriptions textuelles des coups a spontanément développé une représentation interne du plateau de jeu, ce qui suggère le développement d'un modèle abstrait du monde décrit[3].
- Performance sur les benchmarks: Les modèles modernes, tels que GPT-4, obtiennent des résultats de niveau humain (voire supérieurs) à des examens professionnels complexes, ce que certains estiment impossible sans compréhension[8].
Utilisation ironique et discours public
Le terme est devenu si populaire qu'il a même été utilisé de manière ironique par le PDG d'OpenAI, Sam Altman, qui a tweeté : « je suis un perroquet stochastique, et vous aussi » (i am a stochastic parrot, and so r u). Il suggérait ainsi que la parole humaine est aussi, en grande partie, une prédiction probabiliste du mot suivant, retournant la critique contre l'IA[1].
Influence sur le discours scientifique
La métaphore du « perroquet stochastique » reste centrale dans les débats sur les capacités et les limites des LLM. Elle a aidé à formuler le problème de l'absence de compréhension réelle des modèles de langage et a attiré l'attention sur les risques liés à leur développement. Dans le même temps, les progrès rapides dans le domaine des LLM obligent à réévaluer constamment cette métaphore, car les modèles les plus récents présentent un comportement de plus en plus complexe qui ne correspond plus à l'image d'un « perroquet dénué de sens ». Le terme continue d'influencer le discours scientifique, soulignant l'importance d'une analyse critique des capacités des systèmes d'IA et de leurs conséquences sociales[8].
Bibliographie
- Bender, E. M.; Gebru, T.; McMillan-Major, A.; Mitchell, M. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. FAccT 2021.
- Floridi, L.; Chiriatti, M. (2020). GPT-3: Its Nature, Scope, Limits, and Consequences. Minds & Machines, 30(4), 681-694.
- Bommasani, R. et al. (2021). On the Opportunities and Risks of Foundation Models. arXiv:2108.07258.
- Weidinger, L. et al. (2021). Ethical and Social Risks of Harm from Language Models. arXiv:2112.04359.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Perez, E. et al. (2022). Red Teaming Language Models with Language Models. EMNLP 2022.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Du, Z. et al. (2024). Understanding Emergent Abilities of Language Models from the Loss Perspective. arXiv:2403.15796.
- Gerstgrasser, M. et al. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413.
Références
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 'Stochastic Parrot': A Name for AI That Sounds a Bit Less Intelligent. Mint. [1]
- ↑ 2.0 2.1 2.2 Bender, Emily M., et al. «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?». Conference on Fairness, Accountability, and Transparency (FAccT '21). [2]
- ↑ 3.0 3.1 « Abeilles protestataires et perroquets stochastiques : revue des publications critiques et de soutien au développement de l'IA ». Habr. [3]
- ↑ Hao, Karen. «We read the paper that forced Timnit Gebru out of Google. Here's what it says». MIT Technology Review. [4]
- ↑ Vincent, James. «Timnit Gebru's actual paper may explain why Google ejected her». The Verge. [5]
- ↑ «Geoffrey Hinton on the promise, risks of artificial intelligence». 60 Minutes - CBS News. [6]
- ↑ «Stochastic parrot». Wikipedia. [7]
- ↑ 8.0 8.1 «The debate over understanding in AI's large language models». PMC. [8]