Scor BLEU (Bilingual Evaluation Understudy) este un metric utilizat pentru a evalua calitatea de ieșire traducere mașină prin compararea acesteia cu una sau mai multe traduceri de referință. Acest ghid oferă un proces pas cu pas pentru a calcula scorurile BLEU în mod eficient.

Înțelegerea scorului BLEU

Scorul BLEU măsoară cât de strâns se potriveşte o traducere generată de maşină cu referinţele umane. Consideră suprapunerea n-gramelor între candidat şi traducerile de referinţă, împreună cu o pedeapsă de brevititate pentru a descuraja traducerile prea scurte.

Etapa 1: Pregătirea datelor

Aduna traducerea candidatului și una sau mai multe traduceri de referință. Asigurați-vă că toate textele sunt tokenizate în mod constant, divizarea propozițiilor în cuvinte sau unități subword.

Etapa 2: Calculați precizia N-gram

Pentru fiecare dimensiune n-gram (în general 1-4), numărați numărul de n-grame din traducerea candidatului care apar și în traducerile de referință. Împarte acest număr cu numărul total de n-grame din candidat pentru a obține scoruri de precizie pentru fiecare nivel n-gram.

Pasul 3: Aplicaţi pedeapsa pentru libertate

Pedeapsa de brevity (BP) penalizează traducerile care sunt mai scurte decât referinţa.

BP = 1 dacă lungimea candidatului > lungimea de referință; altfel, BP = e^{(1 - lungimea de referință/durata candidatului)}.

Etapa 4: Calculează scorul final al BLEU

Combină precizia n-gram folosind media geometrică și multiplică cu pedeapsa de brevititate:

BLEU = BP * exp (media preciziei log pentru n=1 până la 4).

Sfaturi suplimentare

  • Utilizați mai multe traduceri de referință pentru o mai bună evaluare.
  • Asigurați tokenizarea consecventă în toate textele.
  • Utilizarea instrumentelor sau bibliotecilor existente pentru calcul, cum ar fi NLTK sau SacreBLEU.