불균형 데이터 세트는 기계 학습에 있는 일반적인 도전입니다. 1개의 종류가 두드러지게 된 수증자 다른 경우에, 모형은 미성년성 종류에 빈약한 성과에 지도될지도 모릅니다. 실제적인 전략을 실행하는 것은 모형 정확도와 공정성을 개량할 수 있습니다.

Imbalanced Datasets에 대한 이해

불균형 데이터 세트는 클래스의 배포가 언데일 때 발생합니다. 예를 들어, 사기 탐지, 사기적 거래는 합법적 인 것으로 거의 비교됩니다. 이 불균형을 인식하면 효과적으로 해결하는 첫 단계입니다.

데이터 수준 기술

Data-level 기술은 데이터셋을 균형급 배포에 수정합니다. 일반적인 방법은 다음과 같습니다.

  • Oversampling: SMOTE와 같은 기술을 사용하여 소수성 클래스 샘플을 증가.
  • Undersampling: 미성년자 클래스 크기를 일치하기 위해 대부분의 클래스 샘플을 감소.
  • Data Augmentation: 미성년자 클래스 표현을 강화하기 위해 새로운 합성 샘플을 창조합니다.

Algorithm-Level 전략

학습 알고리즘을 조정하면 클래스의 불균형을 지정할 수 있습니다. 기술에는 다음과 같습니다.

  • Cost-sensitive 학습: 미성년자 클래스 오류에 더 높은 misclassification 비용 할당.
  • 조정 클래스 무게:모델 교육의 중요성을 수정합니다.
  • ] 소수성 클래스 감지를 향상시키기 위해 여러 모델을 결합합니다.

평가 미터

적절한 메트릭을 사용하여 불균형 데이터에 모델 성능을 평가하는 데 필수적입니다. 일반적인 메트릭은 다음과 같습니다.

  • Precision: 예측된 긍정적 중 진정한 긍정적의 비율.
  • Recall:] 실제적인 긍정적 인 결과가 제대로 식별됩니다.
  • F1 점수: 정밀 및 리콜의 조화적 의미.
  • AUC-ROC:] 클래스를 구별하는 모델의 능력을 측정합니다.