Calcolo dei punteggi Bleu per la traduzione automatica Valutazione: Guida passo
Il punteggio BLEU (Bilingual Evaluation Understudy) è una metrica utilizzata per valutare la qualità dell'output della traduzione automatica confrontandola con una o più traduzioni di riferimento.
Capire BLEU Score
Il punteggio BLEU misura come una traduzione generata dalla macchina corrisponda ai riferimenti umani, e considera la sovrapposizione di n-gram tra il candidato e le traduzioni di riferimento, insieme ad una brevità di penalità per scoraggiare le traduzioni eccessivamente corte.
Passo 1: Preparare i dati
Raccogliere la traduzione del candidato e una o più traduzioni di riferimento. Assicurarsi che tutti i testi siano tokenizzati coerentemente, dividendo le frasi in parole o unità di sottoparola.
Passo 2: Calcola la precisione N-gram
Per ogni dimensione n-gram (comune da 1 a 4), contano il numero di n-gram nella traduzione candidata che appaiono anche nelle traduzioni di riferimento. Dividere questo conteggio dal numero totale di n-gram nel candidato per ottenere punteggi di precisione per ogni livello n-gram.
Passo 3: Applicare la penuria di Brevity
La pena di brevità (BP) penalizza le traduzioni che sono più brevi del riferimento.
BP = 1 se lunghezza del candidato > lunghezza di riferimento; altrimenti, BP = e^{(1 - lunghezza di riferimento / lunghezza del candidato)}.
Passo 4: Computo finale BLEU punteggio
Combinare le precisione n-gram utilizzando la media geometrica e moltiplicare per la pena di brevità:
BLEU = BP * exp (media di precisione di log per n=1 a 4).
Ulteriori suggerimenti
- Utilizzare più traduzioni di riferimento per una migliore valutazione.
- Assicurare una tokenizzazione coerente su tutti i testi.
- Utilizzare strumenti o librerie esistenti per il calcolo, come NLTK o SacreBLEU.