Table of Contents
크로스 유효성 검사는 기계 학습 모델의 성능을 평가하기 위해 사용되는 통계 방법입니다. 그것은 여러 하위 세트로 데이터셋을 분할하여 데이터를 멸균하는 모델에 대해 잘 평가하는 데 도움이됩니다. 이 기술은 과잉 방지 및 모델 견고성을 보장하는 데 필수적입니다.
Cross-Validation은 무엇입니까?
크로스 유효성 검사는 여러 부품으로 데이터 세트를 분할하고 일부 부품에서 모델을 훈련하고 다른 사람에 테스트합니다. 가장 일반적인 형태는 k-fold 크로스 유효성입니다. 데이터가 k 동등한 부품으로 나뉩니다. 모델은 k 시간을 훈련하고, 각 시간을 초과하는 것은 유효성 검사를 위해 나머지 부분을 사용하여 훈련합니다.
크로스-발명의 종류
- K-Fold Cross-Validation: k subsets로 데이터를 분할하고 훈련 및 검증 k 시간을 수행합니다.
- Stratified K-Fold: 각 접은 분류 작업에 유용한 클래스의 대표 분포를 가지고 있습니다.
- Leave-One-Out (LOO): 은 유효성 검사를 위한 하나의 데이터 포인트를 사용하며, 각 데이터 포인트에 반복됩니다.
- Repeated Cross-Validation: k-fold Multiple times을 반복하여 보다 안정적인 견적을 얻을 수 있습니다.
연습에 있는 Cross-Validation 적용
크로스 유효성 검사는 데이터셋과 문제에 근거를 둔 적절한 유형의 선택이 포함됩니다. scikit-learn과 같은 대부분의 기계 학습 라이브러리는 크로스 유효성을 쉽게 수행 할 수있는 내장 기능을 제공합니다. 모델의 효과의 신뢰할 수있는 견적을 얻기 위해 모든 접점에서 평균 성능을 평가하는 것이 중요합니다.
Cross-Validation의 이점
- 모델 성능의 더 정확한 견적을 제공합니다.
- 튜닝 하이퍼 파라미터에 효과적으로 도움을 줍니다.
- 과잉의 위험을 감소시킵니다.
- 데이터 효율을 높일 수 있으며, 특히 작은 데이터셋이 있습니다.