BLEU (Bilingual Evaluation Understudy) (RO)

From Systems analysis wiki
Jump to navigation Jump to search

BLEU (din engl. Bilingual Evaluation Understudy — „evaluator bilingv substitut") — este un algoritm pentru evaluarea automată a calității textului tradus de mașină. Evaluarea se realizează prin compararea traducerii-candidat cu una sau mai multe traduceri umane de referință (etalon)[1]. Calitatea este determinată de gradul de similitudine lexicală dintre traducerea automată și cea profesională. După cum remarcau autorii, „cu cât traducerea automată este mai apropiată de traducerea unui profesionist uman, cu atât este mai bună"[2].

Metoda a fost propusă în 2002 de un grup de cercetători de la IBM condus de Kishore Papineni și a devenit una dintre primele metrici care au demonstrat o corelație ridicată cu evaluările experților-traducători. BLEU a câștigat rapid popularitate datorită simplității calculului, independenței lingvistice și corespondenței bune cu evaluarea umană la nivel de corpus de texte[1].

Metodologia de calcul BLEU

BLEU evaluează traducerea prin numărarea corespondenților n-gramelor (secvențe de n cuvinte) dintre traducerea-candidat și traducerile de referință.

1. Precizia modificată a n-gramelor

În primul rând, pentru n-grame de diferite lungimi (de obicei de la 1 la 4) se calculează precizia lor (pn) — proporția n-gramelor din traducerea-candidat care apar în traducerile de referință[3]. Totodată, numărul de corespondențe pentru fiecare n-gramă este limitat la numărul maxim de apariții ale acesteia în oricare dintre textele de referință, pentru a evita supraevaluarea prin repetarea aceluiași cuvânt.

2. Agregarea și media geometrică

Pentru a obține o evaluare unică, preciziile pentru 1-, 2-, 3- și 4-grame sunt agregate folosind media geometrică. Aceasta se face pentru ca o precizie scăzută pentru un tip de n-grame (de exemplu, 4-grame) să influențeze semnificativ scorul final, reflectând calitatea slabă a frazelor lungi. p1p2p3p44

3. Penalizarea pentru brevitate (Brevity Penalty)

Pentru a preveni obținerea unor scoruri umflate prin traduceri prea scurte, dar precise, BLEU introduce penalizarea pentru brevitate (Brevity Penalty, BP). Dacă lungimea traducerii-candidat (c) este semnificativ mai mică decât lungimea traducerii de referință (r), scorul final BLEU se reduce. Penalizarea se calculează după formula: extBP={1extifc>re1r/cextifcr

4. Formula finală BLEU

Scorul BLEU final se calculează ca produsul dintre penalizarea pentru brevitate și media geometrică a preciziilor n-gramelor[4]: extBLEU=extBPexp(n=1Nwnlogpn) unde N este lungimea maximă a n-gramelor (de obicei 4), iar wn — ponderile (de obicei 1/N).

Valoarea BLEU se află în intervalul de la 0 la 1 (adesea înmulțită cu 100 și exprimată în procente). Cu cât rezultatul este mai aproape de 1 (100%), cu atât traducerea este considerată mai „apropiată de cea umană".

Aplicare și importanță

Din momentul publicării, metrica BLEU a devenit standardul de facto pentru evaluarea sistemelor de traducere automată (TA). Ea a permis depășirea „blocajului" în dezvoltarea sistemelor de TA — durata îndelungată și costul ridicat al evaluării manuale. Dezvoltatorii au obținut posibilitatea de a măsura rapid efectul modificărilor din modele și de a elimina prompt soluțiile nereușite[2].

BLEU corelează bine cu evaluările umane la nivelul întregului corpus de texte, dar este nesigur pentru evaluarea propozițiilor individuale[3]. De aceea, metrica a fost utilizată pe scară largă în competițiile standardizate de TA (de exemplu, NIST și WMT) pentru compararea sistemelor.

Limitări și critici

În ciuda răspândirii largi, BLEU prezintă o serie de limitări semnificative:

  • Absența evaluării semantice: BLEU măsoară doar corespondența superficială a cuvintelor și nu este capabil să evalueze dacă sensul textului sursă a fost redat corect. O traducere poate obține un scor ridicat, dar să fie incorectă gramatical sau să denatureze înțelesul[5].
  • Ignorarea sinonimelor și a parafrazelor: Algoritmul penalizează traducerile care folosesc sinonime sau formulări diferite față de referință, chiar dacă acestea sunt complet corecte. Utilizarea mai multor referințe atenuează, dar nu rezolvă complet această problemă.
  • Sensibilitatea la tokenizare: Rezultatele BLEU depind puternic de modul de segmentare a textului în token-uri. Implementări diferite ale tokenizatoarelor pot conduce la valori diferite, făcând compararea modelelor incorectă. Pentru rezolvarea acestei probleme a fost propus standardul SacreBLEU, care unifică calculul metricii[1].
  • Dificultatea aplicării la anumite limbi: BLEU funcționează slab pentru limbile care nu au delimitatori clari de cuvinte (de exemplu, chineza sau japoneza), fără segmentare prealabilă.

Alternative și abordări moderne

În timp, pentru a depăși neajunsurile BLEU au fost propuse noi metrici automate:

  • METEOR: Ia în considerare corespondențele sinonimelor, stemming-ul și ordinea cuvintelor.
  • ROUGE: Utilizat pentru evaluarea rezumării textelor, concentrându-se pe completitudine (recall), nu pe precizie.
  • Metrici antrenabile (Learned Metrics): Abordări moderne care folosesc modele de Machine Learning pentru a ține cont de similitudinea semantică. Metrici precum BLEURT și COMET demonstrează o corelație semnificativ mai ridicată cu evaluările oamenilor decât BLEU clasic[6].

Până în anii 2020, BLEU a pierdut statutul de standard absolut, cedând locul unor metode mai precise[7]. Cu toate acestea, el rămâne o etapă importantă în istoria evaluării TA și continuă să fie utilizat ca punct de referință de bază în măsurarea progresului.

Referințe

  • Ce este scorul BLEU? — Documentația Microsoft Azure

Note

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]