Table of Contents
平衡数据集在许多现实世界应用中很常见,如欺诈检测,医学诊断,异常检测。 解决不平衡对于建立有效的机器学习模型至关重要。 本文探讨了数学原理支持的实用技术,以有效处理不平衡的数据。
理解数据不平衡
当一个类别中的事件数量大大超过另一个类别中的事件数量时,数据不平衡就会发生. 这种不平衡可能使模型偏向多数类别,降低其检测少数群体类别事件的能力. 数学上,如果[N是样本总数,N 少数群体是少数群体类别样本数量,这种不平衡比例是IR = N/N少数群体].
处理不平衡的技术
几种技术可以减轻数据不平衡的影响,这些方法可以大致分为数据级和算法级方法.
数据层面的方法
- 过标:[] 增加少数民族阶级样本,经常使用SMOTE等方法,这些方法根据现有的少数民族样本生成合成数据点.
- 在样本: 减少多数类样本以平衡数据集,这可能会丢失有价值的信息.
- 黑白法式方法:[ 结合过标和过标,优化数据平衡.
算法级方法
- 成本敏感学习:[] 将较高的错误分类费用分配给少数阶级班级错误,以影响模型的焦点.
- 集法:[] 利用助推等技术改进少数阶级的检测.
- 调整决定阈值:修改概率截断,以偏好少数类预测.
数学基础
许多技术都以统计和数学概念为基础。例如,SMOTE通过在少数群体阶层点之间插图来创造合成样本:
x ]]新=x]i ]+羊肉(x]j -i ] ]]]
其xi]和xj]为少数类样本,lambda是一个在0到1之间的随机数字,这种方法确保合成数据位于少数类的特征空间内,保持数据分布的完整性.