Calcolo dei punteggi Bleu per la traduzione automatica Valutazione: Guida passo

Il punteggio BLEU (Bilingual Evaluation Understudy) è una metrica utilizzata per valutare la qualità dell'output della traduzione automatica confrontandola con una o più traduzioni di riferimento.

Capire BLEU Score

Il punteggio BLEU misura come una traduzione generata dalla macchina corrisponda ai riferimenti umani, e considera la sovrapposizione di n-gram tra il candidato e le traduzioni di riferimento, insieme ad una brevità di penalità per scoraggiare le traduzioni eccessivamente corte.

Passo 1: Preparare i dati

Raccogliere la traduzione del candidato e una o più traduzioni di riferimento. Assicurarsi che tutti i testi siano tokenizzati coerentemente, dividendo le frasi in parole o unità di sottoparola.

Passo 2: Calcola la precisione N-gram

Per ogni dimensione n-gram (comune da 1 a 4), contano il numero di n-gram nella traduzione candidata che appaiono anche nelle traduzioni di riferimento. Dividere questo conteggio dal numero totale di n-gram nel candidato per ottenere punteggi di precisione per ogni livello n-gram.

Passo 3: Applicare la penuria di Brevity

La pena di brevità (BP) penalizza le traduzioni che sono più brevi del riferimento.

BP = 1 se lunghezza del candidato > lunghezza di riferimento; altrimenti, BP = e^{(1 - lunghezza di riferimento / lunghezza del candidato)}.

Passo 4: Computo finale BLEU punteggio

Combinare le precisione n-gram utilizzando la media geometrica e moltiplicare per la pena di brevità:

BLEU = BP * exp (media di precisione di log per n=1 a 4).

Ulteriori suggerimenti