Berechnung von Bleu-Scores für die maschinelle Übersetzungsbewertung: Schritt-für-Schritt-Anleitung
BLEU (Bilingual Evaluation Understudy) ist eine Metrik, die zur Bewertung der Qualität der maschinellen Übersetzungsausgabe durch Vergleich mit einer oder mehreren Referenzübersetzungen verwendet wird.
BLEU-Score verstehen
Der BLEU-Score misst, wie eng eine maschinengenerierte Übersetzung mit menschlichen Referenzen übereinstimmt. Er berücksichtigt die Überlappung von n-Gramm zwischen Kandidaten- und Referenzübersetzungen sowie eine Kürzenstrafe, um übermäßig kurze Übersetzungen zu verhindern.
Schritt 1: Daten aufbereiten
Sammeln Sie die Kandidatenübersetzung und eine oder mehrere Referenzübersetzungen, stellen Sie sicher, dass alle Texte konsistent tokenisiert werden, indem Sie Sätze in Wörter oder Unterworteinheiten aufteilen.
Schritt 2: N-Gramm-Präzision berechnen
Für jede n-Gramm-Größe (üblicherweise 1 bis 4) wird die Anzahl der n-Gramm in der Kandidatenübersetzung gezählt, die auch in den Referenzübersetzungen erscheinen, und diese Zahl durch die Gesamtzahl der n-Gramm im Kandidaten geteilt, um Präzisionswerte für jede n-Gramm-Ebene zu erhalten.
Schritt 3: Anwendung der Brevity Penalty
Die Kürzenstrafe (BP) bestraft Übersetzungen, die kürzer sind als die Referenz.
BP = 1 wenn Kandidatenlänge > Referenzlänge; ansonsten BP = e^{(1 - Referenzlänge / Kandidatenlänge)}.
Schritt 4: Berechnen des endgültigen BLEU-Scores
Kombinieren Sie die n-Gramm-Präzision mit dem geometrischen Mittel und multiplizieren Sie sie mit der Kürze:
BLEU = BP * exp (Durchschnitt der log-Präzisionen für n = 1 bis 4).
Zusätzliche Tipps
- Verwenden Sie mehrere Referenzübersetzungen für eine bessere Auswertung.
- Stellen Sie eine konsistente Tokenisierung über alle Texte hinweg sicher.
- Verwenden Sie vorhandene Tools oder Bibliotheken für die Berechnung, wie NLTK oder SacreBLEU.