精确度、回顾度和F1分数是用来评价NLP分类模型性能的重要衡量标准。 它们有助于理解模型对不同类别,特别是不平衡数据集的预测程度。

理解精度

精确度测量模型所做的所有正预测中真实正预测的比例,表明预测正预测病例中有多少是实际正数.

谅解 召回

回顾,又称灵敏度,测量模型正确识别出的实际阳性病例的比例,反映了模型检测阳性病例的能力.

计算 F1- 分数

F1分数是精确和召回的谐音平均值。 它提供了一个平衡两者的单一度量,特别是在分类分布不均时特别有用。

示例计算

假设一个模型预测80个阳性病例,其中60个正确。实际阳性病例总数为70个。

  • 精度:60/80=0.75
  • 回顾: 60/70 ⁇ 0.857
  • F1-分数:2 *(0.75 * 0.857)/(0.75+0.857) + 0.80