Table of Contents
BLEU(双语评价下研)分数是用来通过比较一个或一个以上参考翻译来评价机器翻译输出质量的衡量标准,本指南提供了一个分步法,可以有效计算BLEU分数.
理解BLEU分数
低浓缩铀衡量机器生成的翻译与人类参考文献的匹配程度,认为候选人与参考翻译之间的正克重叠,以及短短的处罚,都不利于翻译过于简短。
步骤1:准备数据
收集候选翻译和一个或多个参考翻译。确保所有文本都一致的标注,将句子分为词组或子词组。
步骤2:计算 N- gram 精度
对于每个n-gm大小(通常为1到4),在候选翻译中计算同样出现在参考翻译中的n-gm数。除以候选翻译中n-g的总数,以获得每个n-gm级别的精确分数。
步骤3:适用不重处罚
短刑对短于参考的翻译进行处罚。
BP=1 如果候选长度 & gt; 参考长度; 否则, BP=e ⁇ (1 - 参考长度/候选长度) ) 。
第4步:计算最后BLEU分数
将正方格精度用几何平均值组合,乘以简洁度的分数:
BLEU = BP * exp(n=1至4的日志精度平均值).
附加提示
- 使用多个参考翻译来进行更好的评价.
- 确保所有文本的标识一致。
- 利用现有的工具或库进行计算,如NLTK或SacreBLEU。