FLORES-200 (EL)

From Systems analysis wiki
Jump to navigation Jump to search

FLORES-200 — είναι ένα σύνολο δεδομένων αξιολόγησης για πολύγλωσση μηχανική μετάφραση, που καλύπτει περίπου 200 γλώσσες του κόσμου. Δημιουργήθηκε από ερευνητές της εταιρείας Meta στο πλαίσιο του έργου No Language Left Behind (NLLB) και παρουσιάστηκε το 2022. Το FLORES-200 αποτελεί επέκταση του προηγούμενου συνόλου FLORES-101 και προορίζεται για την αντικειμενική αξιολόγηση της ποιότητας μετάφρασης, ιδιαίτερα για γλώσσες με περιορισμένους πόρους[1].

Βασικό χαρακτηριστικό του dataset είναι ότι όλα τα κείμενα μεταφράστηκαν από επαγγελματίες μεταφραστές, κάτι που εξασφαλίζει υψηλή ποιότητα στις αναφορικές μεταφράσεις και το καθιστά αξιόπιστο πρότυπο για τη σύγκριση συστημάτων μηχανικής μετάφρασης[2].

Ιστορικό και δημιουργία του συνόλου

Η πρώτη έκδοση, FLORES-101, παρουσιάστηκε το 2022 και περιείχε 3001 προτάσεις από την αγγλόφωνη Wikipedia, μεταφρασμένες σε 101 γλώσσες[3]. Αυτό το σύνολο κάλυψε ένα σημαντικό κενό στην αξιολόγηση συστημάτων μετάφρασης για γλώσσες με περιορισμένα δεδομένα.

Το 2022, στο πλαίσιο του έργου No Language Left Behind, η Meta επέκτεινε το corpus σε 200 γλώσσες, δημιουργώντας το FLORES-200[4]. Η ανάπτυξη αντιμετώπισε μια σειρά από δυσκολίες:

  • Πολλές από τις γλώσσες που προστέθηκαν είχαν χαμηλή τυποποίηση και έλλειψη δίγλωσσων ειδικών.
  • Ορισμένες γλώσσες μεταφράστηκαν όχι απευθείας από τα αγγλικά, αλλά μέσω ενδιάμεσων γλωσσών (ισπανικά, γαλλικά, ρωσικά).
  • Για ορισμένες γλώσσες συμπεριλήφθηκαν διαφορετικά συστήματα γραφής (π.χ. λατινικό και κυριλλικό αλφάβητο), ώστε να ληφθεί υπόψη η χρήση τους σε διαφορετικές κοινότητες[5].

Σύνθεση και δομή

Το corpus FLORES-200 περιλαμβάνει 3001 προτάσεις, επιλεγμένες από 842 διαφορετικά διαδικτυακά άρθρα και έγγραφα των έργων Wikimedia. Σε αντίθεση με την πρώτη έκδοση, οι πηγές περιλαμβάνουν όχι μόνο την Wikipedia, αλλά και άλλα έργα, όπως το Wikinews, το Wikijunior και το Wikivoyage. Αυτό εξασφαλίζει ευρεία θεματική ποικιλία (ειδήσεις, επιστήμη, πολιτισμός, ταξίδια), επιτρέποντας τη διεξοδική αξιολόγηση της ποιότητας μετάφρασης.

Κάθε αγγλική πρόταση μεταφράστηκε επαγγελματικά σε ~200 γλώσσες-στόχους, σχηματίζοντας ένα πλήρως ευθυγραμμισμένο παράλληλο corpus. Το σύνολο χωρίζεται σε τρία μέρη:

  • dev (ανάπτυξη) — για τη ρύθμιση μοντέλων.
  • devtest (ενδιάμεσος έλεγχος) — για προκαταρκτική αξιολόγηση.
  • test (τελικός έλεγχος) — κρυφό μέρος για τη δίκαιη σύγκριση μοντέλων σε διαγωνισμούς.

Για την αναφορά γλωσσών χρησιμοποιείται το πρότυπο ISO 639-3 με ένδειξη του script, για παράδειγμα `eng_Latn` για τα αγγλικά με λατινικό αλφάβητο ή `rus_Cyrl` για τα ρωσικά με κυριλλικό αλφάβητο[5].

Εφαρμογές και σημασία

Το FLORES-200 έγινε βασικό πρότυπο για την αξιολόγηση πολύγλωσσων συστημάτων μηχανικής μετάφρασης. Χρησιμοποιήθηκε για την αξιολόγηση του κορυφαίου μοντέλου της Meta — NLLB-200. Η δοκιμή στο FLORES-200 έδειξε ότι το NLLB-200 βελτίωσε την ποιότητα μετάφρασης κατά μέσο όρο 44% με βάση τη μετρική BLEU σε σύγκριση με τα προηγούμενα καλύτερα συστήματα[6]. Για ορισμένες γλώσσες της Αφρικής και της Ινδίας η αύξηση της ακρίβειας ξεπέρασε το 70%[4].

Η Meta παρείχε ελεύθερη πρόσβαση στο dataset και στα εργαλεία χρήσης του υπό την άδεια Creative Commons BY-SA 4.0. Χάρη σε αυτό, το FLORES-200 γρήγορα διαδόθηκε ευρέως και έγινε de facto πρότυπο σε επιστημονικές εργασίες, διαγωνισμούς μηχανικής μετάφρασης (π.χ. WMT) και πρωτοβουλίες διατήρησης γλωσσών. Το 2023 η κοινότητα OLDI (Open Language Data Initiative) ξεκίνησε την επέκταση του corpus με την ονομασία FLORES+[2].

Σύνδεσμοι

  • Επίσημο dataset στο Hugging Face
  • Επίσημο αποθετήριο στο GitHub

Βιβλιογραφία

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Παραπομπές

  1. «FLoRes-200 Dataset». Papers With Code. [1]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [2]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [3]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [4]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [5]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [6]