Table of Contents
BLEU (Bilingual Evaluation Understudy) score er en metrologi som brukes til å evaluere kvaliteten på maskinoversettelsesutgangen ved å sammenligne den med en eller flere referanseoversettelser. Denne guiden gir en trinn-for-trinn prosess for å beregne BLEU score effektivt.
Forstå BLEU Score
BLEU-scoren måler hvor tett en maskingenerert oversettelse passer til menneskelige referanser. Det vurderer overlappingen av n-gram mellom kandidaten og referanseoversettelser, sammen med en brevity straff for å avverge overflødig korte oversettelser.
Trinn 1: Forbered data
Samle kandidatoversettelsen og en eller flere referanseoversettelser. Sørg for at alle tekster blir tokenisert konsekvent, splitte setninger i ord eller underordenhet.
Trinn 2: Beregn N-gram presisjon
For hver n-gramstørrelse (vanligvis 1 til 4), teller antall n-gram i kandidatoversettelsen som også vises i referanseoversettelsen. Del dette antall med det totale antall n-gram i kandidaten for å få presisjonsscorer for hvert n-gramnivå.
Trinn 3: Påfør Brevity Straffe
Brevhetsstraffen (BP) straffer oversettelser som er kortere enn referansen. Beregn det som:
BP = 1 hvis kandidatlengde > referanselengde; ellers BP = e^{(1 - referanselengde / kandidatlengde)}.
Trinn 4: Beregn endelig BLEU-score
Kombiner n-gram presisjonene ved hjelp av geometrisk middelverdi og multipliseres ved hjelp av revity straffen:
BLEU = BP * exp( gjennomsnittlig logg presisjoner for n=1 til 4).
Tilleggs tips
- Bruk flere referanseoversettelser for bedre evaluering.
- Sørg for konsekvent tokenisering i alle tekster.
- Bruk eksisterende verktøy eller biblioteker for beregning, som NLTK eller SacreBLEU.