데이터셋의 특정 클래스가 다른 사람과 비교하여 크게 나타날 때 클래스의 불균형이 발생합니다. 이 불균형은 작은 클래스가 중요하게 분류하는 작업에서 모델 성능이 좋지 않을 수 있습니다. 주소링 클래스 불균형은 정확하고 신뢰할 수있는 신경 네트워크를 개발하는 데 필수적입니다.

Class Imbalance에 대한 일반적인 기술

몇몇 방법은 신경 네트워크에 있는 mitigate 종류 불균형에 이용됩니다. 이 기술은 개인적으로 적용되거나 더 나은 결과를 위해 결합될 수 있습니다.

데이터 수준 방법

Data-level 접근은 데이터셋을 균형급 배포에 수정합니다. 이 기능은 다음과 같습니다.

  • Oversampling: 의 소수성 클래스 샘플의 수를 증가, 종종 복제 또는 합성 데이터 생성을 통해.
  • Undersampling: 미성년자 클래스와 일치하기 위해 대부분의 클래스 샘플의 수를 감소.
  • SMOTE: 합성광성 과감한 기술로 미성년성 클래스의 새로운 합성 예제를 만듭니다.

Algorithm-Level 기술

이 방법은 학습 알고리즘을 더 나은 처리 imbalanced 데이터로 수정합니다. 예는 다음과 같습니다.

  • Cost-sensitive 학습: 미성년자 수업에 더 높은 misclassification 비용 할당.
  • Focal Loss: 하드 투 classify 예제에서 훈련을 진행하고, 쉬운 부정적인 영향을 줄 수 있습니다.

Real-World 데이터 예시

의료 진단에서 데이터 세트는 종종 몇 가지 긍정적 인 사례를 포함합니다. 과감한 또는 SMOTE 적용은 모델 감도를 향상시킬 수 있습니다. 사기 방지에서 사기 거래가 드물고 비용이 많이 드는 학습은이 사례를 효과적으로 식별하는 데 도움이됩니다.