FLORES-200 (ES)
FLORES-200 es un conjunto de datos de evaluación para la traducción automática multilingüe que abarca alrededor de 200 idiomas del mundo. Fue creado por investigadores de Meta como parte del proyecto No Language Left Behind (NLLB) y presentado en 2022. FLORES-200 es una extensión del conjunto de datos anterior, FLORES-101, y está diseñado para la evaluación objetiva de la calidad de la traducción, especialmente para idiomas de bajos recursos[1].
Una característica clave del conjunto de datos es que todos los textos fueron traducidos por traductores profesionales, lo que garantiza una alta calidad en las traducciones de referencia y lo convierte en un estándar confiable para comparar sistemas de traducción automática[2].
Antecedentes y creación del conjunto de datos
La primera versión, FLORES-101, se presentó en 2022 y contenía 3001 oraciones de la Wikipedia en inglés, traducidas a 101 idiomas[3]. Este conjunto de datos llenó un vacío importante en la evaluación de sistemas de traducción para idiomas con pocos datos.
En 2022, como parte del proyecto No Language Left Behind, Meta amplió el corpus a 200 idiomas, creando FLORES-200[4]. El desarrollo se enfrentó a una serie de dificultades:
- Muchos de los idiomas añadidos tenían una baja estandarización y escasez de especialistas bilingües.
- Algunos idiomas no se tradujeron directamente del inglés, sino a través de idiomas intermedios (español, francés, ruso).
- Para algunos idiomas, se incluyeron diferentes sistemas de escritura (por ejemplo, latino y cirílico) para tener en cuenta su uso en diversas comunidades[5].
Composición y estructura
El corpus FLORES-200 incluye 3001 oraciones, seleccionadas de 842 artículos web y documentos de proyectos de Wikimedia. A diferencia de la primera versión, las fuentes no solo incluyen Wikipedia, sino también otros proyectos como Wikinews, Wikijunior y Wikivoyage. Esto garantiza una amplia diversidad temática (noticias, ciencia, cultura, viajes), lo que permite una verificación exhaustiva de la calidad de la traducción.
Cada oración en inglés fue traducida profesionalmente a aproximadamente 200 idiomas de destino, formando un corpus paralelo completamente alineado. El conjunto de datos se divide en tres partes:
- dev (desarrollo) — para el ajuste de los modelos.
- devtest (pruebas de desarrollo) — para la evaluación preliminar.
- test (pruebas finales) — una parte oculta para la comparación justa de modelos en competiciones.
Para designar los idiomas, se utiliza el estándar ISO 639-3 con la especificación del sistema de escritura, por ejemplo, eng_Latn para el inglés en alfabeto latino o rus_Cyrl para el ruso en alfabeto cirílico[5].
Aplicación e importancia
FLORES-200 se ha convertido en un estándar clave para la evaluación de sistemas de traducción automática multilingües. Fue utilizado para evaluar el modelo insignia de Meta, NLLB-200. Las pruebas en FLORES-200 demostraron que NLLB-200 mejoró la calidad de la traducción en un promedio del 44 % según la métrica BLEU en comparación con los mejores sistemas anteriores[6]. Para algunos idiomas de África e India, el aumento en la precisión superó el 70 %[4].
Meta ha proporcionado acceso libre al conjunto de datos y a las herramientas para su uso bajo la licencia Creative Commons BY-SA 4.0. Gracias a esto, FLORES-200 se difundió rápidamente y se convirtió en el estándar de facto en trabajos científicos, competiciones de traducción automática (como WMT) e iniciativas para la preservación de idiomas. En 2023, la comunidad OLDI (Open Language Data Initiative) comenzó a expandir el corpus bajo el nombre de FLORES+[2].
Enlaces externos
Bibliografía
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Referencias
- ↑ «FLoRes-200 Dataset». Papers With Code. [1]
- ↑ 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
- ↑ Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
- ↑ 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
- ↑ 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
- ↑ Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]