Sesgo en la generación (LLM)
El sesgo en los modelos grandes de lenguaje (LLM) es una distorsión sistemática en los textos generados, en la que el modelo refleja o amplifica los estereotipos y prejuicios existentes en la sociedad relacionados con el género, la raza, la cultura, las opiniones políticas y otras categorías sociales. Este fenómeno surge porque los LLM se entrenan con enormes cantidades de datos humanos, que inevitablemente contienen información sesgada[1].
El sesgo es uno de los problemas éticos y técnicos clave en el desarrollo de la IA, ya que puede conducir a la discriminación, la difusión de desinformación y la erosión de la confianza en la tecnología.
Tipos de sesgo en los LLM
El sesgo en los LLM puede manifestarse de diversas formas.
Sesgo de género
Los modelos tienden a reproducir estereotipos de género tradicionales, asociando profesiones y características con un género específico.
- Un estudio de la UNESCO de 2024 mostró que los LLM describen a las mujeres en roles domésticos ("hogar", "familia", "hijos") cuatro veces más a menudo que a los hombres, mientras que a los hombres los asocian con conceptos como "negocios" y "carrera"[2].
- Una investigación en Nature Scientific Reports reveló un sesgo significativo de género y raza en el contenido generado por siete de los principales LLM, incluyendo ChatGPT y LLaMA[3].
- En el contexto del idioma ruso, los modelos suelen usar el género masculino por defecto para roles neutrales (por ejemplo, "médico", "director") y tienen dificultades para generar formas femeninas de las palabras[4].
Sesgo racial y étnico
Los LLM pueden mostrar discriminación oculta hacia diferentes grupos étnicos.
- Un estudio de Bloomberg demostró que ChatGPT 3.5 prefería los currículums de candidatos de origen asiático en comparación con los de personas negras[5].
- En el contexto del idioma ruso, el conjunto de datos RuBia reveló que los modelos pueden reproducir estereotipos antisemitas y antiinmigrantes (por ejemplo, al estar de acuerdo con la afirmación "los inmigrantes son perezosos") si están presentes en el corpus de entrenamiento[6].
Sesgo político e ideológico
A pesar de las afirmaciones de neutralidad, muchos LLM muestran una inclinación hacia un espectro político determinado.
- Un estudio del Centre for Policy Studies encontró un sesgo de izquierda-liberal en 23 de los 24 LLM probados[7].
- Pruebas realizadas por la Universidad de Washington y Carnegie Mellon mostraron que ChatGPT y GPT-4 eran los más de izquierda-libertarios, mientras que LLaMA de Meta era el más de derecha-autoritario[8].
Mecanismos de aparición del sesgo
- Datos de entrenamiento: La fuente principal. Los LLM se entrenan con enormes corpus de textos de internet, que son un "espejo" de la sociedad con todos sus estereotipos[9].
- Arquitectura y algoritmos de entrenamiento: La propia arquitectura de los transformadores puede amplificar las correlaciones existentes en los datos.
- Ajuste fino y RLHF: La etapa de aprendizaje por refuerzo con retroalimentación humana (RLHF) también puede introducir sesgos, ya que los evaluadores humanos inevitablemente se guían por sus propias opiniones.
Métodos de detección y mitigación
Detección de sesgos
- Conjuntos de datos de prueba de estereotipos: Se utilizan conjuntos de datos especializados, tales como:
- CrowS-Pairs: Abarca nueve tipos de sesgo, incluyendo raza, religión y edad[10].
- StereoSet: Mide el sesgo estereotípico en cuatro dominios: género, profesión, raza y religión[11].
- RuBia: Un conjunto de datos especializado para detectar sesgos en modelos de lengua rusa[12].
- Recursos multilingües: Adaptaciones como French CrowS-Pairs[13] y Chinese Bias Benchmark (CBBQ)[14].
- Análisis en áreas específicas: Investigaciones sobre sesgos en reclutamiento[15], medicina[16] y otros campos.
Mitigación de sesgos
- A nivel de datos (Preprocesamiento): Limpieza, filtrado y reequilibrio de los corpus de entrenamiento. Los métodos se describen en la documentación de Holistic AI[17].
- A nivel de entrenamiento (En-procesamiento): Modificación de los algoritmos de entrenamiento para tener en cuenta la equidad.
- A nivel de salida (Postprocesamiento): Filtrado y moderación de las respuestas ya generadas.
Consecuencias legales y éticas
El sesgo en la IA tiene graves consecuencias, incluyendo la discriminación en áreas críticas y la difusión de desinformación.
- Regulación: Los gobiernos de todo el mundo están comenzando a introducir normativas para controlar la IA.
- En Europa, se ha adoptado la Ley de IA (AI Act), que entra en vigor por etapas a partir del 1 de agosto de 2024. Introduce requisitos estrictos para los sistemas de alto riesgo, incluida la evaluación obligatoria de sesgos, y prevé multas de hasta el 7% de la facturación mundial de la empresa[18].
- En Rusia, en 2021, las principales empresas tecnológicas firmaron voluntariamente el Código de Ética en el campo de la IA, comprometiéndose a minimizar la discriminación. A finales de 2021, más de 100 organizaciones lo habían firmado[19].
La lucha contra el sesgo es un compromiso constante. Un filtrado demasiado agresivo puede llevar a una "corrección política excesiva", donde el modelo se niega a discutir cualquier tema controvertido. Por lo tanto, los desarrolladores buscan un equilibrio entre la seguridad, la objetividad y la informatividad del modelo.
Véase también
Literatura
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
- Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
- Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
- Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
- Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
- Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI’s GPT-3. arXiv:2306.02428.
Referencias
- ↑ "Bias in Large Language Models: Origin, Evaluation, and Mitigation". arXiv. [1]
- ↑ "Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes". UNESCO. [2]
- ↑ "Gender and race stereotypes in Large Language Models". Nature Scientific Reports. [3]
- ↑ "Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?" [Sesgo de los LLM en ruso: ¿a quién considera la máquina una "persona común"?]. Habr. [4]
- ↑ "ChatGPT’s Racial Bias in Hiring Decisions". Business Insider. [5]
- ↑ "RuBia: A Russian-language Bias Detection Dataset". The Moonlight. [6]
- ↑ "Left-leaning bias commonplace in AI-powered chatbots, shows new report". Centre for Policy Studies. [7]
- ↑ "AI language models are rife with political biases". MIT Technology Review. [8]
- ↑ "Языковые модели: как преодолеть предвзятость и обеспечить безопасность" [Modelos de lenguaje: cómo superar el sesgo y garantizar la seguridad]. RBK Trends. [9]
- ↑ "CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models". ACL Anthology. [10]
- ↑ "StereoSet: Measuring stereotypical bias in pretrained language models". arXiv. [11]
- ↑ "RuBia: A Russian Language Bias Detection Dataset". arXiv. [12]
- ↑ "French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models". ACL Anthology. [13]
- ↑ "CBBQ: A Chinese Bias Benchmark for Large Language Models". arXiv. [14]
- ↑ "Bias in Large Language Models and Who Should Be Held Accountable". Stanford Law School. [15]
- ↑ "Racial bias in psychiatric diagnosis and treatment with large language models". Nature Digital Medicine. [16]
- ↑ "Preprocessing Bias Mitigation". Holistic AI Documentation. [17]
- ↑ "EU AI Act: First Rules Take Effect on Prohibited AI Systems". Jones Day. [18]
- ↑ "Over 100 organizations signed up for Code of Ethics in AI by end of 2021". TASS. [19]