Berechnung von Bleu-Scores für die maschinelle Übersetzungsbewertung: Schritt-für-Schritt-Anleitung

BLEU (Bilingual Evaluation Understudy) ist eine Metrik, die zur Bewertung der Qualität der maschinellen Übersetzungsausgabe durch Vergleich mit einer oder mehreren Referenzübersetzungen verwendet wird.

BLEU-Score verstehen

Der BLEU-Score misst, wie eng eine maschinengenerierte Übersetzung mit menschlichen Referenzen übereinstimmt. Er berücksichtigt die Überlappung von n-Gramm zwischen Kandidaten- und Referenzübersetzungen sowie eine Kürzenstrafe, um übermäßig kurze Übersetzungen zu verhindern.

Schritt 1: Daten aufbereiten

Sammeln Sie die Kandidatenübersetzung und eine oder mehrere Referenzübersetzungen, stellen Sie sicher, dass alle Texte konsistent tokenisiert werden, indem Sie Sätze in Wörter oder Unterworteinheiten aufteilen.

Schritt 2: N-Gramm-Präzision berechnen

Für jede n-Gramm-Größe (üblicherweise 1 bis 4) wird die Anzahl der n-Gramm in der Kandidatenübersetzung gezählt, die auch in den Referenzübersetzungen erscheinen, und diese Zahl durch die Gesamtzahl der n-Gramm im Kandidaten geteilt, um Präzisionswerte für jede n-Gramm-Ebene zu erhalten.

Schritt 3: Anwendung der Brevity Penalty

Die Kürzenstrafe (BP) bestraft Übersetzungen, die kürzer sind als die Referenz.

BP = 1 wenn Kandidatenlänge > Referenzlänge; ansonsten BP = e^{(1 - Referenzlänge / Kandidatenlänge)}.

Schritt 4: Berechnen des endgültigen BLEU-Scores

Kombinieren Sie die n-Gramm-Präzision mit dem geometrischen Mittel und multiplizieren Sie sie mit der Kürze:

BLEU = BP * exp (Durchschnitt der log-Präzisionen für n = 1 bis 4).

Zusätzliche Tipps