기능 선택은 효과적인 기계 학습 모델 구축에 중요한 단계입니다. 모델 정확도를 향상시키고 복잡성을 줄이기 위해 가장 관련 변수를 식별하는 것이 포함됩니다. Quantitative 방법은 수치 표준을 기반으로 시스템을 평가하고 기능을 선택하는 접근 방식을 제공합니다.

일반적인 양적 방법

몇몇 양적 기술은 특징 선택을 위해 널리 이용됩니다. 이 방법은 통계 측정 또는 알고리즘 기준을 사용하여 특징의 중요성을 평가합니다. 적합한 방법을 선택하면 자료와 특정한 문제에 달려 있습니다.

필터 방법

필터 방법 평가 기능에 따라 통계적인 관계 대상 변수. 그들은 적절하게 고효율 및 높은 차원 데이터에 적합. 일반적인 필터 기술 포함:

  • Correlation Coefficient:]는 특징과 표적 사이 선형 관계를 측정합니다.
  • Chi-Square Test: 카테고리 변수의 독립성을 돕는다.
  • 문헌 정보: 변수 사이에 공유된 정보의 양을 정량화한다.

포장 방법

래퍼 방법 교육 모델에 의해 기능의 하위 집합을 평가하고 최고의 성능을 산출하는 조합을 선택. 그들은 더 많이 적절하게 집중하지만 종종 더 정확한 결과를 생성. 예는 다음과 같습니다 :

  • Forward Selection: 은 기능 없이 시작하며 한 번에 추가합니다.
  • Backward Elimination: 모든 기능을 시작하며 최소한의 중요한 제거.
  • Recursive Feature Elimination: 모델 무게에 따라 기능 제거.

임베디드 방법

임베디드 메소드는 모델 트레이닝 프로세스 내에서 기능 선택이 통합됩니다. 정규화 기술 또는 트리 기반 알고리즘을 활용함으로써 효율성과 효율성을 균형 잡힌다. 주목할만한 예는 다음과 같습니다.

  • Lasso Regression:] 0에 더 중요한 특징 계수를 수축하기 위하여 L1 정규화 사용.
  • Decision Tree Algorithms: 정보 이득 또는 Gini 불순에 근거한 자연적으로 선택된 기능.
  • Random Forests: 여러 나무의 특징 중요성 점수.