BLEU (Bilingual Evaluation Understudy) poäng är en metrisk som används för att utvärdera kvaliteten på maskinöversättningsproduktion genom att jämföra den med en eller flera referensöversättningar. Denna guide ger en steg-för-steg-process för att beräkna BLEU poäng effektivt.
Förstå BLEU Score
BLEU-poängen mäter hur nära en maskingenererad översättning matchar mänskliga referenser. Det anser överlappningen av n-gram mellan kandidaten och referensöversättningarna, tillsammans med en korthetsstraff för att avskräcka alltför korta översättningar.
Steg 1: Förbered data
Samla kandidatöversättningen och en eller flera referensöversättningar. Se till att alla texter tokeniseras konsekvent, dela meningar i ord eller underordnade enheter.
Steg 2: Beräkna N-gram Precision
För varje n-gram storlek (vanligtvis 1 till 4), räkna antalet n-gram i kandidatöversättningen som också visas i referensöversättningarna. Dela detta räkning med det totala antalet n-gram i kandidaten för att få precisionspoäng för varje n-gram nivå.
Steg 3: Applicera Brevity Penalty
Kortfrihetsstraffet (BP) straffar översättningar som är kortare än referensen. Beräkna det som:
BP = 1 om kandidatlängd > referenslängd; annars BP = eś (1 - referenslängd / kandidatlängd)}.
Steg 4: Beräkning av slutresultatet BLEU
Kombinera n-gram precisioner med geometriska medel och multiplicera med korthetsstraff:
BLEU = BP * exp(genomsnitt för loggprecisioner för n=1 till 4).
Ytterligare tips
- Använd flera referensöversättningar för bättre utvärdering.
- Se till att konsekvent tokenization över alla texter.
- Använd befintliga verktyg eller bibliotek för beräkning, till exempel NLTK eller SacreBLEU.