데이터 불균형은 데이터 세트의 클래스의 배포가 언데일 때 발생합니다. 이것은 크게 초시 학습 모델의 성능에 영향을 줄 수 있으며, 예측을 가속화하고 소수성 클래스의 정확도를 감소시킬 수 있습니다.

Data Imbalance에 대한 이해

많은 실제 시나리오에서 일부 클래스는 다른 것보다 더 일반적입니다. 예를 들어, 사기 탐지에서 사기 거래는 합법적 인 것으로 비교되지 않습니다. 이 불균형은 모델이 미성년자 클래스를 지정하는 데 발생할 수 있습니다.

충격 측정

데이터 불균형이 모델에 영향을 미치는지 평가하려면 몇 미터가 사용될 수 있습니다.

  • Accuracy:는, 높은 정확도로 불균형 데이터 세트에서, 항상 대부분의 클래스를 예측하여 달성될 수 있습니다.
  • Precision and Recall: 긍정적 인 사례를 식별하는 모델의 능력에 대한 통찰력을 제공합니다.
  • F1 점수: 균형 측정을 제공하는 정밀도와 리콜을 결합합니다.
  • ROC-AUC:은 임계값을 통해 클래스를 구별하는 모델의 능력을 측정합니다.

충격을 계산

데이터 불균형의 영향을 받지 않는 한 가지 접근법은 균형 잡힌 데이터 세트에 모델 성능을 비교하는 것입니다. 기술에는 다음과 같습니다.

  • 과잉 또는 undersampling과 같은 샘플링 방법을 적용.
  • SMOTE와 같은 합성 데이터 생성을 사용.
  • 밸런싱 기술 전후에 메트릭을 증발합니다.
  • 정밀, 리콜 및 F1 점수의 분석 변화.

이러한 메트릭을 측정함으로써, 선행자들은 모델 예측에 얼마나 많은 불균형 영향을 평가하고 적절한 완화 전략을 결정할 수 있습니다.