Table of Contents
기능 선택은 모델 교육에 가장 관련 가변을 식별하는 초시 학습의 중요한 단계입니다. Proper 기능 선택은 모델 정확도를 향상시키고, 과잉을 감소시키고, 계산 비용을 줄일 수 있습니다. 이 문서는 기능 선택 프로세스를 최적화하는 주요 계산 및 설계 원칙을 논의합니다.
Calculations in 기능 선택
Calculations in feature selection often involve statistical Measurement that assessments the 중요성 of each features. 일반적인 방법은 상관 계수, 상호 정보, 그리고 통계 검사와 같은 ANOVA 또는 chi-square. 이 계산은 대상 변수에 상대적 기능의 재량 결정에 도움이.
예를 들어, 상관 관계 계수는 1 또는 -1에 가까운 값과 선형 관계를 측정합니다. 상호 정보 캡처 비선형 의존성. 이 미터는 계산 된 중요성을 기반으로 순위 기능으로 선택 프로세스를 안내합니다.
효과적인 기능 선택에 대한 설계 원칙
효과적인 기능 선택은 여러 디자인 원칙에 의존합니다. 우선, 대상 변수에 기능의 relevance를 고려하십시오. Irrelevant 기능은 소음을 도입하고 모델 성능을 감소시킬 수 있습니다. 둘째, 중복 계정; 매우 상관적 인 기능은 중복 될 수 있으며 모델을 단순화하기 위해 제거 할 수 있습니다.
특징 양과 모형 복잡성 사이 셋째, 균형은 근본적입니다. 너무 많은 특징을 포함하여, 너무 몇몇이 중요한 정보를 omit할지도 모르다 동안, 납작할 수 있습니다. 반복 특징 제거와 정규화와 같은 기술은 이 균형을 낙관합니다.
구현을위한 실용적인 팁
- 상관관계 분석으로 시작하여 강력한 기능을 식별합니다.
- 기능 subsets를 평가하기 위해 cross-validation을 사용하십시오.
- Lasso와 같은 정기화 방법을 자동으로 기능 선택.
- 강력한 결과를 위한 여러 선택 기법을 결합합니다.