Table of Contents
监督学习是一种广泛使用的机器学习方法,涉及对标注数据的培训模型,然而,从业者经常遇到共同的陷阱,会影响其模型的性能和可靠性,理解这些问题并应用适当的计算可以帮助减轻其影响.
超适和不适
当一个模型对训练数据了解得过好,包括噪音,导致新数据概括性差时,就会出现过度适应。 当模型过于简单,无法捕捉到基本规律时,就会出现不适应的情况。 诸如训练和验证错误率等计算可以帮助识别这些问题。
例如,比较训练错误(E]train)和验证错误(E]val)可以表示,如果Etrain的训练错误非常低,而Eval的训练错误很高,则两者的高误差都表明适应不足.
类 平衡
当某些类别在数据集中代表性不足,导致模型偏差时,就会出现阶级失衡。 计算阶级分布百分比有助于识别不平衡。
如果数据集有1000个样本,其中900个属于A类,100个属于B类。
A级:900/1000*100=90%
B类:(100/1000)* 100=10%
评价模型性能
精确度、精确度、回溯度和F1-分数等计量对评估模型性能至关重要。
- 真阳性(TP)
- 假阳性( FP)
- 假负数( FN)
例如,精度计算为:
精度=TP / (TP + FP)
处理噪音数据
噪音数据可以扭曲模型训练. 噪音与信号比等计算有助于量化数据质量.
如果数据集包含1000个样本中的100个噪音样本。噪音比是:
噪音比率=(吵闹样本数目)/(总样本)=100/1000=0.1或10%