Table of Contents
NLP 모델이 새로운 데이터에 대한 전반적인 성능을 줄이기 위해 소음과 아웃리에 대해 교육 데이터를 잘 배울 때 발생했습니다. 정기화 기술을 구현하면 과잉 데이터를 방지하고 모델을 개선 할 수 있습니다.
NLP에서 Overfitting 이해
자연적인 언어 가공에서는, overfitting는 훈련 자료에 예외적으로 실행하는 모형에 지도할 수 있고 그러나 시험 자료에 빈약하게. 이 문제점은 많은 모수가 있는 깊은 신경 네트워크 같이 복잡한 모형과 일반적입니다.
NLP의 정기적 인 기술
정규화 방법은 모델 교육 과정에 제약을 추가, 과잉의 위험을 감소. 일반적인 기술은 다음과 같습니다 :
- Dropout:)는 훈련 중에 신경을 막아 공동의 질병을 예방합니다.
- 무게 Decay:손실을 추가하여 큰 무게를 잃는 기능.
- Early Stopping: 유효성능이 향상될 때 훈련을 중지합니다.
- Data Augmentation: 수정 또는 합성 예제를 가진 교육 데이터를 확장합니다.
과잉을 피하기 위한 실용적인 팁
정기화 외에도 다른 전략은 NLP 시스템에서 과잉을 방지 할 수 있습니다.
- 모델의 성능을 평가하기 위해 크로스 유효성을 사용합니다.
- 적절한 아키텍처를 선택하여 제한 모델 복잡성.
- 충분한 다양한 교육 데이터를 보장합니다.
- 모니터링 훈련 및 검증 측정 정기적으로.