Table of Contents
크로스 유효성 검사는 기계 학습 모델의 성능을 평가하기 위해 사용되는 통계 방법입니다. 그것은 독립적 인 데이터 세트에 대해 모델을 일반화하는 방법을 평가하는 데 도움이됩니다. 크로스 유효성 검사의 Proper 구현은 신뢰할 수있는 모델 평가 및 선택을 보장합니다.
Cross-Validation에 대한 이해
크로스 유효성 검사는 데이터가 하위 세트로 분할하고, 이러한 하위 세트의 일부에 모델을 훈련하고 다른 사람에 테스트합니다. 이 과정은 평균 성능 미터를 얻기 위해 여러 번 반복됩니다. 가장 일반적인 방법은 k-fold cross-validation이며, 데이터가 k 동등한 부분으로 나뉩니다.
교차 배양의 계산
k-fold cross-validation에서 다음 단계는 수행됩니다.
- k 동등 부품으로 dataset을 곱합니다.
- 각 반복을 위해, 시험 세트로 1개의 부분을 선택하고 훈련 세트로 남아 있는 k-1 부속.
- 훈련 설정에 모델을 기차 및 테스트 세트에 평가.
- 정확도와 같은 성능 메트릭을 기록하거나 사각형 오류를 의미한다.
- 모든 부품이 테스트 세트로 사용되기까지 반복하십시오.
전체 성능은 각 반복에서 얻은 메트릭을 평균적으로 계산합니다. 이것은 모델의 효과의 더 강력한 견적을 제공합니다.
Cross-Validation에 대한 모범 사례
정확한 평가를 보장하기 위해, 이러한 모범 사례를 고려하십시오:
- dataset 크기에 따라 5 또는 10과 같은 k의 적절한 값을 선택하십시오.
- bias를 방지하기 위해 분할하기 전에 데이터 shuffling을 보장합니다.
- 클래스 배포를 유지하기 위해 imbalanced datasets에 대한 stratified cross-validation을 사용합니다.
- 최적의 결과를 위해 hyperparameter tuning과 교차 유효성을 결합합니다.
- 교육 및 시험 세트 사이에 누출으로부터 정보를 방지함으로써 데이터 누설의 cautious.