BLEU (Bilingual Evaluation Understudy) score er en metrologi som brukes til å evaluere kvaliteten på maskinoversettelsesutgangen ved å sammenligne den med en eller flere referanseoversettelser. Denne guiden gir en trinn-for-trinn prosess for å beregne BLEU score effektivt.

Forstå BLEU Score

BLEU-scoren måler hvor tett en maskingenerert oversettelse passer til menneskelige referanser. Det vurderer overlappingen av n-gram mellom kandidaten og referanseoversettelser, sammen med en brevity straff for å avverge overflødig korte oversettelser.

Trinn 1: Forbered data

Samle kandidatoversettelsen og en eller flere referanseoversettelser. Sørg for at alle tekster blir tokenisert konsekvent, splitte setninger i ord eller underordenhet.

Trinn 2: Beregn N-gram presisjon

For hver n-gramstørrelse (vanligvis 1 til 4), teller antall n-gram i kandidatoversettelsen som også vises i referanseoversettelsen. Del dette antall med det totale antall n-gram i kandidaten for å få presisjonsscorer for hvert n-gramnivå.

Trinn 3: Påfør Brevity Straffe

Brevhetsstraffen (BP) straffer oversettelser som er kortere enn referansen. Beregn det som:

BP = 1 hvis kandidatlengde > referanselengde; ellers BP = e^{(1 - referanselengde / kandidatlengde)}.

Trinn 4: Beregn endelig BLEU-score

Kombiner n-gram presisjonene ved hjelp av geometrisk middelverdi og multipliseres ved hjelp av revity straffen:

BLEU = BP * exp( gjennomsnittlig logg presisjoner for n=1 til 4).

Tilleggs tips

  • Bruk flere referanseoversettelser for bedre evaluering.
  • Sørg for konsekvent tokenisering i alle tekster.
  • Bruk eksisterende verktøy eller biblioteker for beregning, som NLTK eller SacreBLEU.