Berekenen van de Bleu-scores voor de machinevertaling Evaluatie: Stap-voor-stap handleiding

BLEU (Bilingual Evaluation Understudy) score is een metriek die wordt gebruikt om de kwaliteit van de machine vertaling output te evalueren door het te vergelijken met een of meerdere referentie vertalingen. Deze gids biedt een stap-voor-stap proces om BLEU scores effectief te berekenen.

Inzicht in BLEU-score

De BLEU-score meet hoe nauw een door machines gegenereerde vertaling overeenkomt met menselijke referenties. Het beschouwt de overlapping van n-grams tussen de kandidaat en referentievertalingen, samen met een korte straf om te korte vertalingen te ontmoedigen.

Stap 1: Gegevens voorbereiden

Verzamel de kandidaat-vertaling en een of meer referentievertalingen. Zorg ervoor dat alle teksten consequent worden gesymboliseerd, zinnen splitsen in woorden of subwoord eenheden.

Stap 2: Bereken N-gram Precisie

Voor elke n-gramgrootte (vaak 1 tot 4) telt u het aantal n-grams in de kandidaatvertaling die ook in de referentievertalingen voorkomen. Verdeel dit aantal met het totale aantal n-grams in de kandidaat om precisiescores voor elk n-gramniveau te verkrijgen.

Stap 3: Brevity Penalty toepassen

De korte boete (BP) straft vertalingen die korter zijn dan de referentie. Bereken het als:

BP = 1 indien kandidaatlengte > referentielengte; anders, BP = e^{(1 - referentielengte / kandidaatlengte)}.

Stap 4: Bereken de uiteindelijke BLEU-score

Combineer de n-gramprecisies met behulp van geometrisch gemiddelde en vermenigvuldig met de kortheidsboete:

BLEU = BP * exp(gemiddelde van logprecisies voor n=1 tot 4).

Extra tips