크로스 유효성 검사는 기계 학습 모델의 성능을 평가하기 위해 사용되는 통계 방법입니다. 그것은 잘 모델이 데이터를 흔하게 분류하는 방법을 평가하는 데 도움이됩니다. Proper 디자인 및 계산은 신뢰할 수있는 결과를 얻기 위해 필수적이며 과잉 또는 과잉을 방지합니다.

Cross-Validation의 기본 원칙

크로스 유효성 검사는 일부 하위 설정에서 모델을 훈련하고 다른 사람에 테스트하는 하위 설정으로 데이터를 분할하는 것을 포함합니다. 이 과정은 새로운 데이터의 모델의 성능을 추정합니다. 가장 일반적인 방법은 k-fold cross-validation이며 데이터가 k 동등한 부분으로 나뉩니다.

설계 고려 사항

올바른 매개 변수를 선택하면 중요합니다. 접는 수 (k)는 편견과 차이가 있습니다. 더 높은 k는 편향도를 감소하지만 계산 시간을 증가시킵니다. 일반적으로 k는 5 또는 10으로 균형 잡힌 결과를 설정합니다. 데이터를 처리하기 전에 무작위로 셔플링 데이터는 데이터 주문으로 인해 비스듬한 비스듬한을 방지합니다.

신뢰할 수있는 결과에 대한 계산

모든 접을 통해 평균 성능 측정을 계산하는 것은 전체적인 견적을 제공합니다. 또한, 표준 편차를 계산하는 것은 모델의 성능의 가변성에 대한 통찰력을 제공합니다. 이 모델의 안정성을 이해하는 데 도움이됩니다.

  • k 동등 부품으로 데이터 을 나눕니다.
  • k-1 부품에 기차, 나머지 부분에 테스트
  • 모든 k 부품에 대한 반복
  • 성능 측정의 평균과 표준 편차 계산