Table of Contents
Class imbalance는 기계 학습에서 일반적인 도전으로, 한 클래스가 다른 사람보다 훨씬 더 많은 것을 갖게 될 것입니다. 이 불균형은 미성년자 클래스에서 거의 수행되는 모델로 이어질 수 있습니다. 효과적인 기술을 구현하면 예측 정확도와 모델 공정성을 향상시킬 수 있습니다.
Class Imbalance에 대한 이해
데이터셋의 클래스 배포가 언데일 때 클래스의 불균형이 발생합니다. 예를 들어, 사기 탐지, 사기적 거래는 합법적인 것보다 훨씬 적은 것입니다. 이 불균형은 모델이 대부분의 클래스를 선호할 수 있으며, 소수성 클래스 인스턴스의 탐지를 감소시킵니다.
Class Imbalance에 대한 기술
몇 가지 방법은 mitigate 클래스 불균형 문제를 도울 수 있습니다:
- Resampling:)는 미성년자 클래스를 과감하게 하거나 대부분의 클래스를 습득하여 dataset을 조정합니다.
- Synthetic Data Generation:] SMOTE와 같은 기술을 사용하여 미성년성 클래스의 합성 예제를 만듭니다.
- Algorithmic Approaches: ensemble 메서드와 같은 불균형에 강력한 직원 모델.
- Cost-sensitive Learning: 미성년자 수업에 더 높은 misclassification Cost를 할당합니다.
등급 불균형을 증발하는 계산
미터는 불균형과 모델 성능의 범위를 정량화하는 데 도움이됩니다. 일반적인 계산은 다음과 같습니다.
- Imbalance Ratio: 소수성 클래스 인스턴스의 수의 비율.
- Precision and Recall: 긍정적 예측의 정확성과 모든 긍정적인 인스턴스를 찾는 능력 측정.
- F1 점수: , 의 정밀도와 리콜의 조화를 의미, 두 미터 모두 균형.