BLEU (Bilingual Evaluation Understudy) poäng är en metrisk som används för att utvärdera kvaliteten på maskinöversättningsproduktion genom att jämföra den med en eller flera referensöversättningar. Denna guide ger en steg-för-steg-process för att beräkna BLEU poäng effektivt.

Förstå BLEU Score

BLEU-poängen mäter hur nära en maskingenererad översättning matchar mänskliga referenser. Det anser överlappningen av n-gram mellan kandidaten och referensöversättningarna, tillsammans med en korthetsstraff för att avskräcka alltför korta översättningar.

Steg 1: Förbered data

Samla kandidatöversättningen och en eller flera referensöversättningar. Se till att alla texter tokeniseras konsekvent, dela meningar i ord eller underordnade enheter.

Steg 2: Beräkna N-gram Precision

För varje n-gram storlek (vanligtvis 1 till 4), räkna antalet n-gram i kandidatöversättningen som också visas i referensöversättningarna. Dela detta räkning med det totala antalet n-gram i kandidaten för att få precisionspoäng för varje n-gram nivå.

Steg 3: Applicera Brevity Penalty

Kortfrihetsstraffet (BP) straffar översättningar som är kortare än referensen. Beräkna det som:

BP = 1 om kandidatlängd > referenslängd; annars BP = eś (1 - referenslängd / kandidatlängd)}.

Steg 4: Beräkning av slutresultatet BLEU

Kombinera n-gram precisioner med geometriska medel och multiplicera med korthetsstraff:

BLEU = BP * exp(genomsnitt för loggprecisioner för n=1 till 4).

Ytterligare tips

  • Använd flera referensöversättningar för bättre utvärdering.
  • Se till att konsekvent tokenization över alla texter.
  • Använd befintliga verktyg eller bibliotek för beräkning, till exempel NLTK eller SacreBLEU.