FLORES-200 (HI)

From Systems analysis wiki
Jump to navigation Jump to search

FLORES-200 — यह बहुभाषी मशीन अनुवाद के लिए एक मूल्यांकन dataset है, जो विश्व की लगभग 200 भाषाओं को समाहित करता है। इसे Meta कंपनी के शोधकर्ताओं द्वारा No Language Left Behind (NLLB) परियोजना के अंतर्गत बनाया गया था और 2022 में प्रस्तुत किया गया था। FLORES-200, पिछले dataset FLORES-101 का विस्तार है और इसका उद्देश्य अनुवाद गुणवत्ता का वस्तुनिष्ठ मूल्यांकन करना है, विशेष रूप से अल्प-संसाधन भाषाओं के लिए[1]

इस dataset की मुख्य विशेषता यह है कि सभी पाठों का अनुवाद पेशेवर अनुवादकों द्वारा किया गया है, जो संदर्भ अनुवादों की उच्च गुणवत्ता सुनिश्चित करता है और इसे मशीन अनुवाद प्रणालियों की तुलना के लिए एक विश्वसनीय मानक बनाता है[2]

पृष्ठभूमि और निर्माण

पहला संस्करण, FLORES-101, 2022 में प्रस्तुत किया गया था और इसमें अंग्रेज़ी भाषा की Wikipedia से लिए गए 3001 वाक्य थे, जिन्हें 101 भाषाओं में अनुवादित किया गया था[3]। इस dataset ने अल्प-डेटा भाषाओं के लिए अनुवाद प्रणालियों के मूल्यांकन में एक महत्वपूर्ण रिक्तता को भरा।

2022 में No Language Left Behind परियोजना के अंतर्गत Meta कंपनी ने corpus को 200 भाषाओं तक विस्तारित करते हुए FLORES-200 बनाया[4]। विकास के दौरान कई कठिनाइयाँ सामने आईं:

  • जोड़ी गई कई भाषाओं में मानकीकरण का अभाव था और द्विभाषी विशेषज्ञों की कमी थी।
  • कुछ भाषाओं का अनुवाद सीधे अंग्रेज़ी से नहीं, बल्कि मध्यवर्ती भाषाओं (स्पेनिश, फ्रेंच, रूसी) के माध्यम से किया गया।
  • कुछ भाषाओं के लिए विभिन्न लिपि प्रणालियाँ शामिल की गईं (जैसे, लैटिन और सिरिलिक), ताकि विभिन्न समुदायों में उनके उपयोग को ध्यान में रखा जा सके[5]

संरचना और स्वरूप

FLORES-200 corpus में 3001 वाक्य शामिल हैं, जो Wikimedia परियोजनाओं के 842 विभिन्न वेब-लेखों और दस्तावेज़ों से चुने गए हैं। पहले संस्करण के विपरीत, स्रोतों में केवल Wikipedia नहीं, बल्कि Wikinews, Wikijunior और Wikivoyage जैसी अन्य परियोजनाएँ भी शामिल हैं। इससे व्यापक विषयगत विविधता (समाचार, विज्ञान, संस्कृति, यात्रा) सुनिश्चित होती है, जो अनुवाद गुणवत्ता की व्यापक जाँच की अनुमति देती है।

प्रत्येक अंग्रेज़ी वाक्य को पेशेवर रूप से ~200 लक्षित भाषाओं में अनुवादित किया गया है, जिससे एक पूरी तरह से संरेखित समानांतर corpus बनता है। Dataset को तीन भागों में विभाजित किया गया है:

  • dev (विकास) — मॉडल को ट्यून करने के लिए।
  • devtest (मध्यवर्ती परीक्षण) — प्रारंभिक मूल्यांकन के लिए।
  • test (अंतिम परीक्षण) — प्रतियोगिताओं में मॉडलों की निष्पक्ष तुलना के लिए छिपा हुआ भाग।

भाषाओं को इंगित करने के लिए ISO 639-3 मानक का उपयोग लिपि के उल्लेख के साथ किया जाता है, उदाहरण के लिए, लैटिन लिपि में अंग्रेज़ी के लिए `eng_Latn` या सिरिलिक लिपि में रूसी के लिए `rus_Cyrl`[5]

उपयोग और महत्व

FLORES-200 बहुभाषी मशीन अनुवाद प्रणालियों के मूल्यांकन का एक प्रमुख मानक बन गया है। इसका उपयोग Meta की प्रमुख मॉडल — NLLB-200 — के मूल्यांकन के लिए किया गया था। FLORES-200 पर परीक्षण से पता चला कि NLLB-200 ने पिछली सर्वश्रेष्ठ प्रणालियों की तुलना में BLEU मेट्रिक पर औसतन 44% अनुवाद गुणवत्ता में सुधार किया[6]। अफ्रीका और भारत की कुछ भाषाओं के लिए सटीकता में वृद्धि 70% से अधिक रही[4]

Meta ने Creative Commons BY-SA 4.0 लाइसेंस के अंतर्गत dataset और उपकरणों तक मुफ्त पहुँच प्रदान की। इसके कारण FLORES-200 ने शीघ्र ही व्यापक प्रसार प्राप्त किया और वैज्ञानिक कार्यों, मशीन अनुवाद प्रतियोगिताओं (जैसे WMT) तथा भाषा संरक्षण पहलों में वास्तविक मानक बन गया। 2023 में OLDI (Open Language Data Initiative) समुदाय ने corpus को FLORES+ नाम से विस्तारित करना शुरू किया[2]

संदर्भ

  • Hugging Face पर आधिकारिक dataset
  • GitHub पर आधिकारिक repository

साहित्य

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

टिप्पणियाँ

  1. «FLoRes-200 Dataset». Papers With Code. [१]
  2. 2.0 2.1 «FLORES+ Translation and Machine Translation Evaluation for the Erzya Language». Proceedings of the Ninth Conference on Machine Translation (WMT24). [२]
  3. Goyal, N., et al. «The Flores-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation». Transactions of the Association for Computational Linguistics. [३]
  4. 4.0 4.1 «New AI Model Translates 200 Languages, Making Technology Accessible to More People». Meta Newsroom. [४]
  5. 5.0 5.1 «Muennighoff/flores200». Hugging Face. [५]
  6. Costa-jussà, M.R., et al. «No Language Left Behind: Scaling Human-Centered Machine Translation». arXiv:2207.04672. [६]