Calculando escores Bleu para avaliação da tradução de máquina: Guia passo a passo
BLEU (Bilingual Evaluation Understudy) pontuação é uma métrica usada para avaliar a qualidade da tradução de máquina saída, comparando-o com uma ou mais traduções de referência. Este guia fornece um processo passo a passo para calcular BLEU pontuações de forma eficaz.
Compreender a pontuação da UEBL
A pontuação BLEU mede quão próxima uma tradução gerada por máquina corresponde às referências humanas. Considera a sobreposição de n-gramas entre o candidato e as traduções de referência, juntamente com uma pena de brevidade para desencorajar traduções excessivamente curtas.
Passo 1: Preparar os Dados
Reúna a tradução do candidato e uma ou mais traduções de referência. Certifique-se de que todos os textos são tokenized consistentemente, dividindo frases em palavras ou unidades de subpalavra.
Passo 2: Calcular a precisão do N-grama
Para cada tamanho de n-grama (comumente 1 a 4), conte o número de n-gramas na tradução candidata que também aparecem nas traduções de referência. Divida esta contagem pelo número total de n-gramas no candidato para obter pontuações de precisão para cada nível de n-grama.
Passo 3: Aplicar a Pena de Brevidade
A pena de brevidade (BP) penaliza traduções que são mais curtas do que a referência. Calculá-la como:
BP = 1 se o comprimento do candidato & gt; comprimento de referência; caso contrário, BP = e^{ (1 - comprimento de referência / comprimento do candidato)}.
Passo 4: Calcular a pontuação final da BLEU
Combinar as precisões de n-gramas utilizando a média geométrica e multiplicar pela penalidade de brevidade:
BLEU = BP * exp(média de precisão de log para n=1 a 4).
Dicas adicionais
- Use várias traduções de referência para uma melhor avaliação.
- Garantir a tokenização consistente em todos os textos.
- Utilize ferramentas ou bibliotecas existentes para cálculo, como o NLTK ou o SacreBLEU.