Berekenen van de Bleu-scores voor de machinevertaling Evaluatie: Stap-voor-stap handleiding
BLEU (Bilingual Evaluation Understudy) score is een metriek die wordt gebruikt om de kwaliteit van de machine vertaling output te evalueren door het te vergelijken met een of meerdere referentie vertalingen. Deze gids biedt een stap-voor-stap proces om BLEU scores effectief te berekenen.
Inzicht in BLEU-score
De BLEU-score meet hoe nauw een door machines gegenereerde vertaling overeenkomt met menselijke referenties. Het beschouwt de overlapping van n-grams tussen de kandidaat en referentievertalingen, samen met een korte straf om te korte vertalingen te ontmoedigen.
Stap 1: Gegevens voorbereiden
Verzamel de kandidaat-vertaling en een of meer referentievertalingen. Zorg ervoor dat alle teksten consequent worden gesymboliseerd, zinnen splitsen in woorden of subwoord eenheden.
Stap 2: Bereken N-gram Precisie
Voor elke n-gramgrootte (vaak 1 tot 4) telt u het aantal n-grams in de kandidaatvertaling die ook in de referentievertalingen voorkomen. Verdeel dit aantal met het totale aantal n-grams in de kandidaat om precisiescores voor elk n-gramniveau te verkrijgen.
Stap 3: Brevity Penalty toepassen
De korte boete (BP) straft vertalingen die korter zijn dan de referentie. Bereken het als:
BP = 1 indien kandidaatlengte > referentielengte; anders, BP = e^{(1 - referentielengte / kandidaatlengte)}.
Stap 4: Bereken de uiteindelijke BLEU-score
Combineer de n-gramprecisies met behulp van geometrisch gemiddelde en vermenigvuldig met de kortheidsboete:
BLEU = BP * exp(gemiddelde van logprecisies voor n=1 tot 4).
Extra tips
- Gebruik meerdere referentievertalingen voor een betere evaluatie.
- Zorg voor consistente tokenisatie in alle teksten.
- Gebruik bestaande tools of bibliotheken voor berekening, zoals NLTK of SacreBLEU.