Table of Contents
Scor BLEU (Bilingual Evaluation Understudy) este un metric utilizat pentru a evalua calitatea de ieșire traducere mașină prin compararea acesteia cu una sau mai multe traduceri de referință. Acest ghid oferă un proces pas cu pas pentru a calcula scorurile BLEU în mod eficient.
Înțelegerea scorului BLEU
Scorul BLEU măsoară cât de strâns se potriveşte o traducere generată de maşină cu referinţele umane. Consideră suprapunerea n-gramelor între candidat şi traducerile de referinţă, împreună cu o pedeapsă de brevititate pentru a descuraja traducerile prea scurte.
Etapa 1: Pregătirea datelor
Aduna traducerea candidatului și una sau mai multe traduceri de referință. Asigurați-vă că toate textele sunt tokenizate în mod constant, divizarea propozițiilor în cuvinte sau unități subword.
Etapa 2: Calculați precizia N-gram
Pentru fiecare dimensiune n-gram (în general 1-4), numărați numărul de n-grame din traducerea candidatului care apar și în traducerile de referință. Împarte acest număr cu numărul total de n-grame din candidat pentru a obține scoruri de precizie pentru fiecare nivel n-gram.
Pasul 3: Aplicaţi pedeapsa pentru libertate
Pedeapsa de brevity (BP) penalizează traducerile care sunt mai scurte decât referinţa.
BP = 1 dacă lungimea candidatului > lungimea de referință; altfel, BP = e^{(1 - lungimea de referință/durata candidatului)}.
Etapa 4: Calculează scorul final al BLEU
Combină precizia n-gram folosind media geometrică și multiplică cu pedeapsa de brevititate:
BLEU = BP * exp (media preciziei log pentru n=1 până la 4).
Sfaturi suplimentare
- Utilizați mai multe traduceri de referință pentru o mai bună evaluare.
- Asigurați tokenizarea consecventă în toate textele.
- Utilizarea instrumentelor sau bibliotecilor existente pentru calcul, cum ar fi NLTK sau SacreBLEU.