Calculando los puntos de Bleu para la traducción automática Evaluación: Guía paso a paso
BLEU (Bilingual Evaluation Understudy) score es una métrica utilizada para evaluar la calidad de la producción de traducción automática comparándola con una o más traducciones de referencia. Esta guía proporciona un proceso paso a paso para calcular las puntuaciones BLEU de manera efectiva.
Entender el puntaje de BLEU
La puntuación de BLEU mide lo estrechamente que una traducción generada por máquina coincide con las referencias humanas. Considera la superposición de los n-gramas entre el candidato y las traducciones de referencia, junto con una pena de brevedad para desalentar traducciones demasiado cortas.
Paso 1: Preparar los datos
Recopilar la traducción candidata y una o más traducciones de referencia. Asegurar que todos los textos se tokenizan consistentemente, dividiendo frases en palabras o unidades de subpalabra.
Paso 2: Calcular la precisión de N-gram
Para cada n-gram tamaño (comúnmente 1 a 4), cuenta el número de n-gramas en la traducción candidata que también aparecen en las traducciones de referencia. Divide este recuento por el número total de n-gramos en el candidato para obtener puntajes de precisión para cada n-gram nivel.
Paso 3: Aplicar la sanción de la gravedad
La pena de brevedad (BP) penaliza las traducciones que son más cortas que la referencia. Cálculo como:
BP = 1 si la longitud de referencia > longitud de referencia; de lo contrario, BP = e^{(1 - longitud de referencia / longitud de candidato)}.
Paso 4: Computar el marcador final de BLEU
Combina las precisións n-gram usando media geométrica y multiplica por la penalidad de brevedad:
BLEU = BP * exp(promedio de precisión de registro para n=1 a 4).
Consejos adicionales
- Utilice múltiples traducciones de referencia para una mejor evaluación.
- Asegurar la tokenización constante en todos los textos.
- Utilizar herramientas o bibliotecas existentes para el cálculo, como NLTK o SacreBLEU.