Supervised Learning은 라벨 데이터에 훈련 모델을 포함하는 널리 사용되는 기계 학습 접근법입니다. 그러나, 실무자는 종종 모델의 성능과 신뢰성에 영향을 줄 수있는 일반적인 pitfalls를 만나. 이러한 문제를 이해하고 적절한 계산을 적용하면 영향을 미칩니다.

과잉 과 Underfitting

모델이 교육 데이터를 잘 배울 때 발생하면 소음을 포함하여, 새로운 데이터에 대한 빈번한 일반화에 선도. 모델이 너무 간단 하 게 하 게 하 게 하 게 하 게 하 게 하 게 결과. 훈련 및 검증 오류율과 같은 계산 이러한 문제를 식별할 수 있습니다.

예를 들어, 훈련 오류 (E[]train) 및 검증 오류 (E]val)가 E[]train]가 E]]val가 높을 때 매우 낮습니다. 결국, 두 번째로 높은 오류가 제안됩니다.

종류 불균형

Class imbalance는 일부 클래스가 데이터 세트에서 비롯된 모델로 이어질 때 발생합니다. 클래스 배포 비율을 계산하면 불균형을 식별할 수 있습니다.

데이터 세트에는 클래스 A 및 100 클래스 B에 속하는 900 개의 샘플이 있습니다. 클래스 배포 비율은 다음과 같습니다.

종류 A: (900/1000) * 100 = 90%

클래스 B: (100/1000) * 100 = 10%

모델 성능 평가

정확도, 정밀도, 리콜, F1-score와 같은 미터는 모형 성과를 평가하기를 위해 근본적입니다. 계산은 confusion matrix 성분을 포함합니다:

  • 진실한 긍정적 (TP)
  • False 긍정적 (FP)
  • 퓨즈 네거티브 (FN)

예를 들어, 정밀도는 다음과 같이 계산됩니다.

정밀도 = TP/(TP + FP)

Noisy Data를 활용

Noisy 데이터는 모델 교육을 찡시킬 수 있습니다. 소음에 할당 비율과 같은 계산은 데이터 품질을 정량화하는 데 도움이됩니다.

dataset를 공급하는 것은 1000의 총 표본에서 100개의 시끄러운 표본을 포함합니다. 소음 비율은:

잡음 비율 = (노이시 샘플의 수) / (총 샘플) = 100 / 1000 = 0.1 또는 10 %