FLORES-200 (DE)

From Systems analysis wiki
Jump to navigation Jump to search

FLORES-200 ist ein Evaluationsdatensatz für die mehrsprachige maschinelle Übersetzung, der rund 200 Sprachen der Welt abdeckt. Er wurde von Forschern des Unternehmens Meta im Rahmen des Projekts No Language Left Behind (NLLB) entwickelt und im Jahr 2022 vorgestellt. FLORES-200 ist eine Erweiterung des früheren Datensatzes FLORES-101 und dient der objektiven Bewertung der Übersetzungsqualität, insbesondere für ressourcenarme Sprachen[1].

Ein wesentliches Merkmal des Datensatzes ist, dass alle Texte von professionellen Übersetzern übersetzt wurden, was eine hohe Qualität der Referenzübersetzungen gewährleistet und ihn zu einem zuverlässigen Standard für den Vergleich von maschinellen Übersetzungssystemen macht[2].

Hintergrund und Erstellung des Datensatzes

Die erste Version, FLORES-101, wurde 2022 vorgestellt und enthielt 3001 Sätze aus der englischsprachigen Wikipedia, die in 101 Sprachen übersetzt wurden[3]. Dieser Datensatz schloss eine wichtige Lücke bei der Evaluierung von Übersetzungssystemen für Sprachen mit geringen Datenmengen.

Im Jahr 2022 erweiterte Meta im Rahmen des Projekts No Language Left Behind das Korpus auf 200 Sprachen und schuf damit FLORES-200[4]. Die Entwicklung war mit einer Reihe von Schwierigkeiten verbunden:

  • Viele der hinzugefügten Sprachen hatten einen geringen Standardisierungsgrad und es mangelte an zweisprachigen Fachkräften.
  • Einige Sprachen wurden nicht direkt aus dem Englischen, sondern über Brückensprachen (z. B. Spanisch, Französisch, Russisch) übersetzt.
  • Für einige Sprachen wurden verschiedene Schriftsysteme (z. B. lateinische und kyrillische Schrift) berücksichtigt, um ihre Verwendung in unterschiedlichen Gemeinschaften abzubilden[5].

Aufbau und Struktur

Das FLORES-200-Korpus umfasst 3001 Sätze, die aus 842 verschiedenen Web-Artikeln und Dokumenten von Wikimedia-Projekten ausgewählt wurden. Im Gegensatz zur ersten Version stammen die Quellen nicht nur aus Wikipedia, sondern auch aus anderen Projekten wie Wikinews, Wikijunior und Wikivoyage. Dies gewährleistet eine breite thematische Vielfalt (Nachrichten, Wissenschaft, Kultur, Reisen), die eine umfassende Überprüfung der Übersetzungsqualität ermöglicht.

Jeder englische Satz wurde professionell in rund 200 Zielsprachen übersetzt, wodurch ein vollständig paralleles Korpus entstand. Der Datensatz ist in drei Teile aufgeteilt:

  • dev (Entwicklung) – zur Feinabstimmung der Modelle.
  • devtest (Zwischentest) – zur vorläufigen Evaluierung.
  • test (Abschlusstest) – ein verborgener Teil für den fairen Vergleich von Modellen in Wettbewerben.

Zur Kennzeichnung der Sprachen wird der Standard ISO 639-3 mit Angabe des Schriftsystems verwendet, zum Beispiel `eng_Latn` für Englisch in lateinischer Schrift oder `rus_Cyrl` für Russisch in kyrillischer Schrift[5].

Anwendung und Bedeutung

FLORES-200 hat sich zu einem Schlüsselstandard für die Evaluierung mehrsprachiger maschineller Übersetzungssysteme entwickelt. Er wurde zur Bewertung des Flaggschiff-Modells von Meta, NLLB-200, verwendet. Tests mit FLORES-200 zeigten, dass NLLB-200 die Übersetzungsqualität im Durchschnitt um 44 % gemäß der BLEU-Metrik im Vergleich zu früheren Spitzenmodellen verbesserte[6]. Für einige afrikanische und indische Sprachen betrug die Genauigkeitssteigerung sogar mehr als 70 %[4].

Meta hat den Datensatz und die zugehörigen Tools unter der Lizenz Creative Commons BY-SA 4.0 frei zugänglich gemacht. Dadurch fand FLORES-200 schnell weite Verbreitung und wurde zum De-facto-Standard in wissenschaftlichen Arbeiten, Wettbewerben zur maschinellen Übersetzung (wie WMT) und Initiativen zur Spracherhaltung. Im Jahr 2023 begann die OLDI-Community (Open Language Data Initiative), das Korpus unter dem Namen FLORES+ zu erweitern[2].

Literatur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Einzelnachweise

  1. „FLoRes-200 Dataset“. Papers With Code. [1]
  2. 2.0 2.1 „FLORES+ Translation and Machine Translation Evaluation for the Erzya Language“. Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. „The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation“. Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 „New AI Model Translates 200 Languages, Making Technology Accessible to More People“. Meta Newsroom. [4]
  5. 5.0 5.1 „Muennighoff/flores200“. Hugging Face. [5]
  6. Costa-jussà, M.R., et al. „No Language Left Behind: Scaling Human-Centered Machine Translation“. arXiv:2207.04672. [6]