Table of Contents
Supervised Learning은 모델이 라벨 데이터로 훈련되는 기계 학습에 공통적인 접근법입니다. 워크플로우의 모범 사례가 더 나은 모델 성능과 신뢰성을 보장합니다. 이 문서는 모델 교육에 대한 데이터 사전 처리에서 핵심 단계입니다.
데이터 수집 및 준비
첫 번째 단계는 문제를 정확하게 나타내는 관련 데이터를 수집합니다. 데이터는 오류, 중복 및 불허한 정보를 제거하기 위해 청소되어야 합니다. Proper 포맷 및 조직은 효과적인 분석 및 모델 교육을 촉진합니다.
데이터 사전 처리
Preprocessing은 모델링에 적합한 형식으로 원료를 변환합니다. 이에는 누락된 값, 인코딩 categorical 변수, 기능 스케일링이 포함됩니다. 이 단계는 모델 정확도와 융합을 향상시킵니다.
특징 선택과 공학
관련 기능을 선택하면 복잡성을 줄이고 모델 성능을 향상시킵니다. 변화 또는 조합을 통해 새로운 기능을 만들고 예측 능력을 향상시킬 수 있습니다.
모델 교육 및 평가
적절한 알고리즘을 선택하면 문제 유형과 데이터 특성에 따라 달라집니다. 교육은 교육 및 검증 세트, 튜닝 하이퍼 파라미터 및 정확도, 정밀도, 또는 리콜과 같은 메트릭을 사용하여 성능에 대한 데이터를 분할합니다.
- 크로스 유효성
- Hyperparameter 조정
- 모델 검증
- 성능 지표 분석