기계 학습 모델이 소음과 아웃리에를 포함한 교육 데이터를 잘 배울 때 발생하면 새로운 데이터에 대한 전반적인 능력을 줄일 수 있습니다. 주소 초과는 데이터셋에 잘 수행되는 강력한 모델을 만드는 데 필수적입니다.

높은 품질

모델이 과도하게 복잡하게 사용할 수 있는 데이터의 양에 관계가 있을 때 발생 합니다. 그것은 훈련 데이터보다 오히려 아래에서 소음을 캡처, 교육 데이터에 높은 정확도에 선도하지만 테스트 데이터에 대한 빈번한 성능.

극복을 방지하는 기술

몇몇 방법은 기계 학습 모형에서 overfitting를 감소시키기 위하여 고용될 수 있습니다:

  • Cross-Validation: 모델 매개 변수를 조정하는 교육 및 검증 세트로 데이터를 분할.
  • Regularization: L1 또는 L2 정규화와 같은 복잡성에 대한 처벌을 추가합니다.
  • Pruning: 분기를 제거하여 결정적인 나무와 같은 간단한 모델은 전원을 제공하지 않는.
  • Early Stopping: 유효성 데이터에 대한 성능이 감소될 때 Halting 교육.
  • Dropout: 신경 네트워크에서 훈련 중에 거의 신경을 자극한다.

실제 예제

이 기술을 구현하면 모델의 일반화를 크게 향상시킬 수 있습니다. 예를 들어 선형 회귀의 정기화가 계수를 감소시키고, 피팅 노이즈에서 모델을 방지합니다. 신경 네트워크의 드롭 아웃을 사용하여 특정 신경에 대한 의존을 방지하고 더 나은 학습을 촉진합니다.

기술의 올바른 조합을 선택하면 데이터 및 모델 유형에 따라 다릅니다. 유효성 데이터의 정기적 평가는 과잉 및 조정 전략을 식별하는 데 필수적입니다.