Sesgo en la generación (LLM)

From Systems analysis wiki
Jump to navigation Jump to search

El sesgo en los modelos grandes de lenguaje (LLM) es una distorsión sistemática en los textos generados, en la que el modelo refleja o amplifica los estereotipos y prejuicios existentes en la sociedad relacionados con el género, la raza, la cultura, las opiniones políticas y otras categorías sociales. Este fenómeno surge porque los LLM se entrenan con enormes cantidades de datos humanos, que inevitablemente contienen información sesgada[1].

El sesgo es uno de los problemas éticos y técnicos clave en el desarrollo de la IA, ya que puede conducir a la discriminación, la difusión de desinformación y la erosión de la confianza en la tecnología.

Tipos de sesgo en los LLM

El sesgo en los LLM puede manifestarse de diversas formas.

Sesgo de género

Los modelos tienden a reproducir estereotipos de género tradicionales, asociando profesiones y características con un género específico.

  • Un estudio de la UNESCO de 2024 mostró que los LLM describen a las mujeres en roles domésticos ("hogar", "familia", "hijos") cuatro veces más a menudo que a los hombres, mientras que a los hombres los asocian con conceptos como "negocios" y "carrera"[2].
  • Una investigación en Nature Scientific Reports reveló un sesgo significativo de género y raza en el contenido generado por siete de los principales LLM, incluyendo ChatGPT y LLaMA[3].
  • En el contexto del idioma ruso, los modelos suelen usar el género masculino por defecto para roles neutrales (por ejemplo, "médico", "director") y tienen dificultades para generar formas femeninas de las palabras[4].

Sesgo racial y étnico

Los LLM pueden mostrar discriminación oculta hacia diferentes grupos étnicos.

  • Un estudio de Bloomberg demostró que ChatGPT 3.5 prefería los currículums de candidatos de origen asiático en comparación con los de personas negras[5].
  • En el contexto del idioma ruso, el conjunto de datos RuBia reveló que los modelos pueden reproducir estereotipos antisemitas y antiinmigrantes (por ejemplo, al estar de acuerdo con la afirmación "los inmigrantes son perezosos") si están presentes en el corpus de entrenamiento[6].

Sesgo político e ideológico

A pesar de las afirmaciones de neutralidad, muchos LLM muestran una inclinación hacia un espectro político determinado.

  • Un estudio del Centre for Policy Studies encontró un sesgo de izquierda-liberal en 23 de los 24 LLM probados[7].
  • Pruebas realizadas por la Universidad de Washington y Carnegie Mellon mostraron que ChatGPT y GPT-4 eran los más de izquierda-libertarios, mientras que LLaMA de Meta era el más de derecha-autoritario[8].

Mecanismos de aparición del sesgo

  • Datos de entrenamiento: La fuente principal. Los LLM se entrenan con enormes corpus de textos de internet, que son un "espejo" de la sociedad con todos sus estereotipos[9].
  • Arquitectura y algoritmos de entrenamiento: La propia arquitectura de los transformadores puede amplificar las correlaciones existentes en los datos.
  • Ajuste fino y RLHF: La etapa de aprendizaje por refuerzo con retroalimentación humana (RLHF) también puede introducir sesgos, ya que los evaluadores humanos inevitablemente se guían por sus propias opiniones.

Métodos de detección y mitigación

Detección de sesgos

  • Conjuntos de datos de prueba de estereotipos: Se utilizan conjuntos de datos especializados, tales como:
    • CrowS-Pairs: Abarca nueve tipos de sesgo, incluyendo raza, religión y edad[10].
    • StereoSet: Mide el sesgo estereotípico en cuatro dominios: género, profesión, raza y religión[11].
    • RuBia: Un conjunto de datos especializado para detectar sesgos en modelos de lengua rusa[12].
    • Recursos multilingües: Adaptaciones como French CrowS-Pairs[13] y Chinese Bias Benchmark (CBBQ)[14].
    • Análisis en áreas específicas: Investigaciones sobre sesgos en reclutamiento[15], medicina[16] y otros campos.

Mitigación de sesgos

  • A nivel de datos (Preprocesamiento): Limpieza, filtrado y reequilibrio de los corpus de entrenamiento. Los métodos se describen en la documentación de Holistic AI[17].
  • A nivel de entrenamiento (En-procesamiento): Modificación de los algoritmos de entrenamiento para tener en cuenta la equidad.
  • A nivel de salida (Postprocesamiento): Filtrado y moderación de las respuestas ya generadas.

Consecuencias legales y éticas

El sesgo en la IA tiene graves consecuencias, incluyendo la discriminación en áreas críticas y la difusión de desinformación.

  • Regulación: Los gobiernos de todo el mundo están comenzando a introducir normativas para controlar la IA.
  • En Europa, se ha adoptado la Ley de IA (AI Act), que entra en vigor por etapas a partir del 1 de agosto de 2024. Introduce requisitos estrictos para los sistemas de alto riesgo, incluida la evaluación obligatoria de sesgos, y prevé multas de hasta el 7% de la facturación mundial de la empresa[18].
  • En Rusia, en 2021, las principales empresas tecnológicas firmaron voluntariamente el Código de Ética en el campo de la IA, comprometiéndose a minimizar la discriminación. A finales de 2021, más de 100 organizaciones lo habían firmado[19].

La lucha contra el sesgo es un compromiso constante. Un filtrado demasiado agresivo puede llevar a una "corrección política excesiva", donde el modelo se niega a discutir cualquier tema controvertido. Por lo tanto, los desarrolladores buscan un equilibrio entre la seguridad, la objetividad y la informatividad del modelo.

Véase también

Literatura

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI’s GPT-3. arXiv:2306.02428.

Referencias

  1. "Bias in Large Language Models: Origin, Evaluation, and Mitigation". arXiv. [1]
  2. "Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes". UNESCO. [2]
  3. "Gender and race stereotypes in Large Language Models". Nature Scientific Reports. [3]
  4. "Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?" [Sesgo de los LLM en ruso: ¿a quién considera la máquina una "persona común"?]. Habr. [4]
  5. "ChatGPT’s Racial Bias in Hiring Decisions". Business Insider. [5]
  6. "RuBia: A Russian-language Bias Detection Dataset". The Moonlight. [6]
  7. "Left-leaning bias commonplace in AI-powered chatbots, shows new report". Centre for Policy Studies. [7]
  8. "AI language models are rife with political biases". MIT Technology Review. [8]
  9. "Языковые модели: как преодолеть предвзятость и обеспечить безопасность" [Modelos de lenguaje: cómo superar el sesgo y garantizar la seguridad]. RBK Trends. [9]
  10. "CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models". ACL Anthology. [10]
  11. "StereoSet: Measuring stereotypical bias in pretrained language models". arXiv. [11]
  12. "RuBia: A Russian Language Bias Detection Dataset". arXiv. [12]
  13. "French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models". ACL Anthology. [13]
  14. "CBBQ: A Chinese Bias Benchmark for Large Language Models". arXiv. [14]
  15. "Bias in Large Language Models and Who Should Be Held Accountable". Stanford Law School. [15]
  16. "Racial bias in psychiatric diagnosis and treatment with large language models". Nature Digital Medicine. [16]
  17. "Preprocessing Bias Mitigation". Holistic AI Documentation. [17]
  18. "EU AI Act: First Rules Take Effect on Prohibited AI Systems". Jones Day. [18]
  19. "Over 100 organizations signed up for Code of Ethics in AI by end of 2021". TASS. [19]