크로스 유효성 검사는 기계 학습 모델의 성능을 평가하기 위해 사용되는 통계 방법입니다. 그것은 독립적 인 데이터 세트에 대해 모델을 일반화하는 방법을 평가하는 데 도움이됩니다. 크로스 유효성 검사의 Proper 구현은 신뢰할 수있는 모델 평가 및 선택을 보장합니다.

Cross-Validation에 대한 이해

크로스 유효성 검사는 데이터가 하위 세트로 분할하고, 이러한 하위 세트의 일부에 모델을 훈련하고 다른 사람에 테스트합니다. 이 과정은 평균 성능 미터를 얻기 위해 여러 번 반복됩니다. 가장 일반적인 방법은 k-fold cross-validation이며, 데이터가 k 동등한 부분으로 나뉩니다.

교차 배양의 계산

k-fold cross-validation에서 다음 단계는 수행됩니다.

  • k 동등 부품으로 dataset을 곱합니다.
  • 각 반복을 위해, 시험 세트로 1개의 부분을 선택하고 훈련 세트로 남아 있는 k-1 부속.
  • 훈련 설정에 모델을 기차 및 테스트 세트에 평가.
  • 정확도와 같은 성능 메트릭을 기록하거나 사각형 오류를 의미한다.
  • 모든 부품이 테스트 세트로 사용되기까지 반복하십시오.

전체 성능은 각 반복에서 얻은 메트릭을 평균적으로 계산합니다. 이것은 모델의 효과의 더 강력한 견적을 제공합니다.

Cross-Validation에 대한 모범 사례

정확한 평가를 보장하기 위해, 이러한 모범 사례를 고려하십시오:

  • dataset 크기에 따라 5 또는 10과 같은 k의 적절한 값을 선택하십시오.
  • bias를 방지하기 위해 분할하기 전에 데이터 shuffling을 보장합니다.
  • 클래스 배포를 유지하기 위해 imbalanced datasets에 대한 stratified cross-validation을 사용합니다.
  • 최적의 결과를 위해 hyperparameter tuning과 교차 유효성을 결합합니다.
  • 교육 및 시험 세트 사이에 누출으로부터 정보를 방지함으로써 데이터 누설의 cautious.