BLEU (Bilingual Evaluation Understudy) (BN)

From Systems analysis wiki
Jump to navigation Jump to search

BLEU (ইংরেজি Bilingual Evaluation Understudy — «দ্বিভাষিক প্রতিস্থাপনকারী মূল্যায়নকারী») — এটি মেশিন অনূদিত পাঠ্যের গুণমান স্বয়ংক্রিয়ভাবে মূল্যায়নের একটি অ্যালগরিদম। মূল্যায়ন করা হয় প্রার্থী অনুবাদটিকে এক বা একাধিক আদর্শ (রেফারেন্স) মানব অনুবাদের সঙ্গে তুলনা করে[1]। গুণমান নির্ধারিত হয় পেশাদার অনুবাদের সঙ্গে মেশিন অনুবাদের শাব্দিক সাদৃশ্যের মাত্রা দ্বারা। লেখকরা যেমন উল্লেখ করেছিলেন, «মেশিন অনুবাদ যত বেশি একজন পেশাদার মানুষের অনুবাদের কাছাকাছি হয়, সেটি তত ভালো»[2]

পদ্ধতিটি ২০০২ সালে কিশোর পাপিনেনি-র নেতৃত্বে IBM-এর একদল গবেষক প্রস্তাব করেছিলেন এবং এটি প্রথম দিকের এমন একটি metric হয়ে ওঠে যা বিশেষজ্ঞ অনুবাদকদের মূল্যায়নের সঙ্গে উচ্চ সহসম্পর্ক দেখিয়েছিল। BLEU দ্রুত জনপ্রিয়তা অর্জন করে গণনার সরলতা, ভাষা-নিরপেক্ষতা এবং পাঠ্য corpus স্তরে মানব মূল্যায়নের সঙ্গে ভালো মিলের কারণে[1]

BLEU গণনার পদ্ধতি

BLEU অনুবাদ মূল্যায়ন করে প্রার্থী অনুবাদ ও আদর্শ অনুবাদের মধ্যে n-gram (nটি শব্দের ক্রম)-এর মিল গণনা করে।

১. পরিবর্তিত n-gram নির্ভুলতা

প্রথমে বিভিন্ন দৈর্ঘ্যের n-gram-এর (সাধারণত ১ থেকে ৪ পর্যন্ত) নির্ভুলতা (pn) গণনা করা হয় — প্রার্থী অনুবাদের n-gram-এর মধ্যে কোনগুলো আদর্শ অনুবাদে পাওয়া যায় তার অনুপাত[3]। এ ক্ষেত্রে প্রতিটি n-gram-এর মিলের সংখ্যা যেকোনো আদর্শ পাঠ্যে সেটির সর্বোচ্চ উপস্থিতির সংখ্যার মধ্যে সীমাবদ্ধ রাখা হয়, যাতে একই শব্দের পুনরাবৃত্তির কারণে মূল্যায়ন স্ফীত না হয়।

২. একত্রীকরণ ও জ্যামিতিক গড়

একটি একক মূল্যায়ন পেতে, ১-, ২-, ৩- ও ৪-gram-এর নির্ভুলতাগুলো জ্যামিতিক গড়ের মাধ্যমে একত্রিত করা হয়। এটি করা হয় যাতে এক ধরনের n-gram-এর (যেমন ৪-gram) কম নির্ভুলতা চূড়ান্ত স্কোরকে উল্লেখযোগ্যভাবে প্রভাবিত করে, দীর্ঘ বাক্যাংশের দুর্বল গুণমান প্রতিফলিত করে। p1p2p3p44

৩. সংক্ষিপ্ততার জরিমানা (Brevity Penalty)

অতিরিক্ত সংক্ষিপ্ত কিন্তু নির্ভুল অনুবাদের কারণে স্ফীত মূল্যায়ন প্রতিরোধ করতে, BLEU সংক্ষিপ্ততার জরিমানা (Brevity Penalty, BP) প্রবর্তন করে। যদি প্রার্থী অনুবাদের দৈর্ঘ্য (c) আদর্শ অনুবাদের দৈর্ঘ্য (r)-এর তুলনায় উল্লেখযোগ্যভাবে কম হয়, তবে চূড়ান্ত BLEU স্কোর হ্রাস পায়। জরিমানা নিম্নলিখিত সূত্র অনুযায়ী গণনা করা হয়: BP={1if c>re1r/cif cr

৪. BLEU-এর চূড়ান্ত সূত্র

চূড়ান্ত BLEU স্কোর গণনা করা হয় সংক্ষিপ্ততার জরিমানা ও n-gram নির্ভুলতার জ্যামিতিক গড়ের গুণফল হিসেবে[4]: BLEU=BPexp(n=1Nwnlogpn) যেখানে N হলো n-gram-এর সর্বোচ্চ দৈর্ঘ্য (সাধারণত ৪), এবং wn হলো ওজন (সাধারণত 1/N)।

BLEU-এর মান ০ থেকে ১ পরিসরে থাকে (প্রায়ই ১০০ দিয়ে গুণ করে শতকরা হিসেবে প্রকাশ করা হয়)। ফলাফল ১ (১০০%)-এর যত কাছাকাছি, অনুবাদটি মানব অনুবাদের তত বেশি «কাছাকাছি» বলে বিবেচিত হয়।

প্রয়োগ ও গুরুত্ব

প্রকাশের পর থেকে BLEU metric মেশিন অনুবাদ (MT) সিস্টেম মূল্যায়নের ক্ষেত্রে কার্যত একটি মান হয়ে ওঠে। এটি MT সিস্টেমের উন্নয়নের «সংকীর্ণ পথ» — ম্যানুয়াল মূল্যায়নের দীর্ঘসূত্রিতা ও ব্যয়বহুলতা — অতিক্রম করতে সহায়তা করে। ডেভেলপাররা দ্রুত মডেলের পরিবর্তনের প্রভাব পরিমাপ করতে এবং দ্রুত ব্যর্থ সমাধান বাদ দিতে সক্ষম হন[2]

BLEU সমগ্র corpus স্তরে মানব মূল্যায়নের সঙ্গে ভালো সহসম্পর্ক দেখায়, কিন্তু পৃথক বাক্য মূল্যায়নের ক্ষেত্রে এটি অবিশ্বস্ত[3]। তাই এই metric ব্যাপকভাবে MT-এর মানসম্পন্ন প্রতিযোগিতায় (যেমন NIST ও WMT) সিস্টেম তুলনার জন্য ব্যবহৃত হয়েছে।

সীমাবদ্ধতা ও সমালোচনা

ব্যাপক প্রচলন সত্ত্বেও BLEU-এর বেশ কিছু উল্লেখযোগ্য সীমাবদ্ধতা রয়েছে:

  • অর্থগত মূল্যায়নের অনুপস্থিতি: BLEU কেবল শব্দের উপরিতলীয় মিল পরিমাপ করে এবং মূল পাঠ্যের অর্থ সঠিকভাবে প্রকাশ হয়েছে কিনা তা মূল্যায়ন করতে পারে না। একটি অনুবাদ উচ্চ স্কোর পেতে পারে কিন্তু ব্যাকরণগতভাবে ভুল বা অর্থ বিকৃত করতে পারে[5]
  • প্রতিশব্দ ও paraphrase উপেক্ষা: অ্যালগরিদম এমন অনুবাদকে শাস্তি দেয় যেগুলো আদর্শের চেয়ে প্রতিশব্দ বা ভিন্ন প্রকাশভঙ্গি ব্যবহার করে, এমনকি যদি সেগুলো সম্পূর্ণ সঠিক হয়। একাধিক আদর্শ ব্যবহার এই সমস্যা কমায়, তবে সম্পূর্ণ সমাধান করে না।
  • Tokenization-এর প্রতি সংবেদনশীলতা: BLEU-এর ফলাফল পাঠ্যকে token-এ বিভক্ত করার পদ্ধতির উপর ব্যাপকভাবে নির্ভর করে। বিভিন্ন tokenizer বাস্তবায়ন ভিন্ন মান তৈরি করতে পারে, মডেল তুলনাকে ত্রুটিপূর্ণ করে তোলে। এই সমস্যা সমাধানের জন্য SacreBLEU মান প্রস্তাব করা হয়েছে, যা metric গণনাকে একীভূত করে[1]
  • কিছু ভাষায় প্রয়োগের জটিলতা: BLEU এমন ভাষায় ভালো কাজ করে না যেগুলোতে স্পষ্ট শব্দ বিভাজক নেই (যেমন চীনা বা জাপানি), পূর্ববর্তী বিভাজন ছাড়া।

বিকল্প ও আধুনিক পদ্ধতি

সময়ের সাথে সাথে BLEU-এর দুর্বলতা কাটিয়ে উঠতে নতুন স্বয়ংক্রিয় metric প্রস্তাব করা হয়েছে:

  • METEOR: প্রতিশব্দের মিল, stemming ও শব্দের ক্রম বিবেচনা করে।
  • ROUGE: পাঠ্য সংক্ষেপণ মূল্যায়নের জন্য ব্যবহৃত হয়, নির্ভুলতার পরিবর্তে পূর্ণতা (recall)-এর উপর মনোযোগ দিয়ে।
  • শেখানো metric (Learned Metrics): আধুনিক পদ্ধতি যেগুলো অর্থগত সাদৃশ্য বিবেচনার জন্য Machine Learning মডেল ব্যবহার করে। BLEURTCOMET-এর মতো metric গুলো ক্লাসিক BLEU-এর তুলনায় মানুষের মূল্যায়নের সঙ্গে উল্লেখযোগ্যভাবে বেশি সহসম্পর্ক দেখায়[6]

২০২০-এর দশকের মধ্যে BLEU নিঃশর্ত মানের মর্যাদা হারিয়ে আরও নির্ভুল পদ্ধতির কাছে স্থান ছেড়ে দিয়েছে[7]। তবুও এটি MT মূল্যায়নের ইতিহাসে একটি গুরুত্বপূর্ণ মাইলফলক হিসেবে রয়ে গেছে এবং অগ্রগতি পরিমাপে মূল রেফারেন্স বিন্দু হিসেবে ব্যবহৃত হতে থাকে।

তথ্যসূত্র

  • BLEU মূল্যায়ন কী? — Microsoft Azure ডকুমেন্টেশন

টীকা

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [১]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [২]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [৩]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [৪]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [৫]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [৬]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [৭]