BLEU (Bilingual Evaluation Understudy) 점수는 1 개 이상의 참조 번역을 비교하여 기계 번역 출력의 품질을 평가하는 데 사용되는 미터입니다. 이 가이드는 BLEU 점수를 효과적으로 계산하는 단계별 프로세스를 제공합니다.

BLEU 점수 이해

BLEU 점수는 기계 생성 된 번역 일치 인간 참조를 밀접하게하는 방법을 측정합니다. 그것은 후보자와 참조 번역 사이에 n 그램의 과잉을 고려하고, brevity 처벌과 함께 간략한 짧은 번역.

단계 1: Data 준비

후보 번역 및 하나 이상의 참조 번역을 가집니다. 모든 텍스트를 보관하고 문장을 단어 나 하위 단어 단위로 나눕니다.

2단계: N-gram 정밀도를 계산

각 n-gram 크기 (일반적으로 1 ~ 4)의 경우, 참조 번역에 표시된 후보 번역의 n-grams 수를 계산합니다. 이 수를 계산하여 후보자의 총 n-grams의 총 수를 계산하여 각 n-gram 레벨의 정밀도 점수를 취득합니다.

3 단계 : Brevity Penalty 적용

brevity 처벌 (BP)는 참조보다 짧은 번역을 처벌. 다음과 같이 계산:

BP = 1 후보 길이 및 gt; 참조 길이; 그렇지 않으면, BP = e^{(1 - 참조 길이 / 후보 길이)}.

4 단계 : 컴퓨터 최종 BLEU 점수

지하학적인 의미를 사용하여 n 그램 정밀도를 결합하고 brevity 처벌에 의해 곱합니다:

BLEU = BP * 폭발 (n=1에서 4)에 대한 로그 정밀도의 평균.

추가 팁

  • 더 나은 평가를 위한 여러 참조 번역을 사용합니다.
  • 모든 텍스트를 통해 일관된 토큰화를 보장합니다.
  • NLTK 또는 SacreBLEU와 같은 계산에 대한 기존 도구 또는 라이브러리를 활용하십시오.