기능 선택은 모델 교육에 가장 관련 변수를 식별하는 기계 학습에서 사용되는 과정입니다. 그것은 모델 성능을 향상 돕고, 과감한 감소, 과잉 감소. 이 문서는 일반적인 기법을 논의하고 응용 프로그램을 설명하는 실용적인 예를 제공합니다.

필터 방법

필터 방법 통계 측정에 근거한 기능의 relevance를 평가합니다. 그들은 높 차원 자료를 위해 빠르고 적당합니다. 일반적인 기술은 상관 계수, chi-square 시험 및 상호 정보를 포함합니다.

예를 들어, 상관관계를 사용하여 대상 변수에 높은 상관관계가 선택되어 있지만, 낮은 상관 관계가 훼손되어 있습니다. 이 방법은 간단하지만 기능간에 상호 작용을 볼 수 있습니다.

포장 방법

포장 방법은 모델을 훈련하고 최고의 성능을 산출하는 조합을 선택하여 기능의 하위 세트를 평가합니다. 그들은 더 정확하지만 적절하게 집중됩니다.

기술에는 재cursive 기능 제거 (RFE) 및 앞으로 또는 뒤쪽 선택이 포함됩니다. 예를 들어, RFE는 반복적으로 모델을 훈련하고 최소 중요한 기능을 제거하고 최적의 성능이 달성 될 때까지 하위 세트를 정제합니다.

임베디드 방법

임베디드 방법 모델 교육 과정 동안 기능 선택 수행. 그들은 덜 중요한 기능을 뚫는 정규화 기술을 통합.

예시에는 Lasso (L1 정규화) 및 랜덤 포레스트와 같은 트리 기반 알고리즘이 포함되어 있으며, 이는 기능의 중요성 점수를 제공합니다. 이 방법의 균형 정확도와 효율성을 제공합니다.

Practical 예제

집 가격을 예측하는 수많은 기능과 데이터 세트를 공급합니다. 필터 방법을 사용하여 가장 높은 상관관계를 가격을 선택할 수 있습니다. 그런 다음, RFE를 적용하여 포장 방법을 사용하여 하위 세트를 정제합니다. 마지막으로, 임베디드 기능 중요성 점수를 사용하여 모델을 선택 완료하십시오.