Table of Contents
Supervised Learning은 라벨 데이터에 훈련 모델을 포함하는 인기있는 기계 학습 접근법입니다. 그러나, 실무자는 종종 모델 성능에 영향을 줄 수있는 일반적인 실수를 발생합니다. 이러한 오류를 인식하고 그(것)들을 피하는 방법을 이해하는 것은 결과를 개선하고 더 신뢰할 수있는 결과를 보장합니다.
과잉 과 Underfitting
모델이 교육 데이터를 잘 배울 때 발생하면 소음과 아웃렛을 포함한, 새로운 데이터에 대한 능력을 줄일 수 있습니다. 모델이 너무 심하게 캡처 할 때 모델이 너무 간단하게 발생합니다. 두 문제는 비소 데이터에 대한 가난한 성능으로 이어질 수 있습니다.
충분한 자료 및 불균형 종류
이 문서는 귀하가 읽을 수 있는 모든 자료를 무료로 제공합니다. 이 문서는 귀하가 읽을 수 있는 모든 자료를 무료로 제공합니다. 이 문서는 귀하가 읽을 수 있는 모든 자료에 대한 정보를 수집하는 것입니다.
Data Preprocessing를 무시
Data preprocessing은 교육에 적합한 형식으로 원시 데이터를 청소 및 변환하는 데 필수적입니다. 정상적인화, 누락된 값을 처리하거나, categorical 변수를 인코딩하는 것과 같은 걸음 단계는 하위 모델 성능으로 이어질 수 있습니다.
실수를 피하기 위해 일반적인 전략
- 모델의 성능을 평가하기 위해 크로스 유효성을 사용합니다.
- Data 품질을 향상시키기 위한 기능 엔지니어링 적용
- 재 샘플링 기술로 균형 데이터셋.
- 과잉을 방지하기 위해 일반적으로 튜너.
- 모니터링 및 검증 측정은 underfitting 또는 overfitting의 징후를 나타냅니다.