BLEU(バイリンガル評価アンダースタディ)スコアは、それを1つ以上の参照翻訳と比較することにより、機械翻訳の出力の品質を評価するために使用されるメトリックです。 このガイドは、BLEUスコアを効果的に計算するためのステップバイステッププロセスを提供します。

BLEUスコアの理解

BLEUスコアは、機械で生成された翻訳が人間の参照と一致する方法を厳密に測定します。これは、候補者と参照翻訳の間のnグラムの重複を考慮し、逆に短い翻訳を開示するというブレンディティーのペナルティを考慮します。

ステップ1:データの準備

候補者の翻訳と1つ以上の参照翻訳を収集します。すべてのテキストが一貫してトークン化されていることを確認し、文章を単語やサブワード単位に分割します。

ステップ2:Nグラムの精密を計算する

各nグラムサイズ(一般的に1〜4)では、参照翻訳にも表示される候補の翻訳にnグラムの数字をカウントします。nグラムの合計数でこのカウントを分割して、各nグラムレベルごとに精度スコアを取得できます。

ステップ3: ブレビティペナルティを適用

修正ペナルティ(BP)は、参照よりも短い翻訳をペナルティ化します。次のように計算します。

BP = 1 候補の長さが>の場合; 参照長さ; それ以外の場合は、BP = e^{(1 - 参照長さ/候補の長さ)}.

ステップ4: 最終的なBLEUのスコアを計算して下さい

nグラムの精度を幾何学的な意味で組み合わせ、ブレーブのペナルティで乗算します。

BLEU = BP * exp(n = 1から4) のログ精度の平均値。

追加のヒント

  • 複数の参照翻訳を使用して、より優れた評価を行います。
  • すべてのテキスト間で一貫したトークン化を確保します。
  • 既存のツールやライブラリを、NLTKやSacreBLEUなどの計算に利用します。