Table of Contents
크로스 유효성 검사는 기계 학습 모델의 성능을 평가하기 위해 사용되는 통계 방법입니다. 그것은 잘 모델이 과잉의 위험을 감소시키기 위해 일반화하는 방법을 평가하는 데 도움이됩니다. 효과적인 크로스 유효성 검사 기법을 구현하는 것은 강력한 모델 구축에 필수적입니다.
Cross-Validation에 대한 이해
Cross-validation은 여러 하위 설정으로 dataset을 분할하는 것을 포함합니다. 모델은 일부 하위 설정에 훈련되고 다른 사람에 테스트됩니다. 이 과정은 모델의 성능을 보장하기 위해 몇 번 반복되어 다른 데이터 분할에 따라 일관성이 있습니다.
공통의 교차-발효 기술
여러 기법은 크로스 유효성을 수행하기 위해 사용되며, 각 시나리오에 적합 :
- K-Fold Cross-Validation:] k-1 부품에 대한 데이터와 나머지 하나에 대한 테스트에 대한 K-1 부품에 대한 교육. 이 프로세스는 k 시간을 반복합니다.
- K-Fold:] K-Fold와 유사한, 불균형 데이터셋에 유용, 접기 전의 클래스 배포를 유지한다.
- Leave-One-Out (LOO): 테스트에 대한 하나의 데이터 포인트를 사용 하 고 훈련을 위한 나머지, 각 데이터 포인트에 대 한 반복.
구현을위한 모범 사례
크로스 유효성에 대한 이점을 극대화하려면 다음 모범 사례를 고려하십시오.
- dataset size에 따라 'k'의 적절한 값을 선택합니다.
- bias를 줄이기 위해 나누기 전에 데이터 shuffling을 보장합니다.
- 불균형 클래스와 분류 문제를 위한 stratified 메소드를 사용합니다.
- 최적의 결과를 위해 hyperparameter tuning과 교차 유효성을 결합합니다.